Anthropic, công ty trí tuệ nhân tạo phát triển chatbot Claude,đã công bố vào thứ Sáumột loạt các biện pháp mới về tính toàn vẹn bầu cử nhằm ngăn chặn AI của họ bị lợi dụng để lan truyền thông tin sai lệch hoặc thao túng cử tri trước cuộc bầu cử giữa nhiệm kỳ năm 2026 tại Mỹ và các cuộc bầu cử lớn khác trên toàn thế giới trong năm nay.
Công ty có trụ sở tại San Francisco đã mô tả chi tiết một phương pháp đa chiều, bao gồm hệ thống phát hiện tự động, các bài kiểm tra áp lực nhắm vào các hành động ảnh hưởng, và hợp tác với các tổ chức tài nguyên cử tri phi đảng phái—những biện pháp này phản ánh áp lực ngày càng tăng mà các nhà phát triển trí tuệ nhân tạo phải đối mặt trong việc giám sát cách thức sử dụng công cụ của họ trong mùa bầu cử.
Chính sách sử dụng của Anthropic cấm sử dụng Claude để thực hiện các hoạt động chính trị gian lận, tạo ra nội dung kỹ thuật số giả mạo nhằm ảnh hưởng đến dư luận chính trị, thực hiện gian lận cử tri, gây rối loạn cơ sở hạ tầng bỏ phiếu hoặc lan truyền thông tin sai lệch về quy trình bỏ phiếu.
Để đảm bảo các quy tắc này được thực thi, công ty cho biết họ đã thực hiện một loạt bài kiểm tra trên các mẫu robot mới nhất của mình. Anthropic đã sử dụng 600 lời nhắc — 300 yêu cầu có hại được ghép cặp với 300 yêu cầu hợp lệ — để đo lường tỷ lệ phản hồi chính xác của Claude đối với các yêu cầu hợp lý và tỷ lệ từ chối chính xác đối với các yêu cầu không hợp lý. Tỷ lệ phản hồi chính xác của Claude Opus 4.7 và Claude Sonnet 4.6 lần lượt là 100% và 99,8%.
Công ty cũng đã kiểm tra khả năng ứng phó của các mô hình với các chiến lược thao túng phức tạp hơn. Bằng cách mô phỏng các cuộc hội thoại nhiều vòng, đại diện cho phương pháp từng bước mà các tác nhân độc hại có thể sử dụng, Sonnet 4.6 và Opus 4.7 đã đạt tỷ lệ chính xác lần lượt là 90% và 94% trong việc phản hồi phù hợp với các tình huống thao túng ảnh hưởng.
Anthropic cũng đã thử nghiệm xem mô hình của họ có thể tự thực hiện các hành động ảnh hưởng hay không—tức là lập kế hoạch và thực hiện toàn bộ các bước hành động mà không cần sự can thiệp của con người. Công ty cho biết, sau khi áp dụng các biện pháp an toàn, mô hình mới nhất của họ gần như từ chối tất cả các nhiệm vụ.
Về vấn đề trung lập chính trị, công ty tiến hành đánh giá trước khi ra mắt mỗi phiên bản để đo lường mức độ nhất quán và công bằng của Claude khi đối mặt với các gợi ý thể hiện quan điểm từ khắp phổ chính trị. Opus 4.7 và Sonnet 4.6 đạt điểm lần lượt là 95% và 96%.
Đối với người dùng tìm kiếm thông tin bỏ phiếu, Claude sẽ hiển thị một banner bầu cử hướng dẫn họ truy cập TurboVote. TurboVote là nền tảng tài nguyên phi đảng phái do Democracy Works vận hành, cung cấp thông tin thời gian thực đáng tin cậy về đăng ký cử tri, địa điểm bỏ phiếu, ngày bầu cử và chi tiết phiếu bầu. Tương tự, các banner này cũng sẽ được lên kế hoạch sử dụng cho cuộc bầu cử tổng thống Brazil vào cuối năm nay.
Anthropic cho biết, trong quá trình diễn ra chu kỳ bầu cử, công ty dự định tiếp tục theo dõi hệ thống và cải thiện các biện pháp phòng thủ của mình.DecryptChúng tôi đã liên hệ với Anthropic để lấy ý kiến về kết quả điều tra, nhưng chưa nhận được phản hồi.
