Anthropic, perusahaan kecerdasan buatan yang mengembangkan chatbot Claude,menyatakan pada hari Jumatserangkaian langkah baru untuk menjaga integritas pemilu yang bertujuan mencegah kecerdasan buatannya dimanfaatkan untuk menyebarkan informasi palsu atau memanipulasi pemilih menjelang pemilu tengah masa jabatan Amerika Serikat tahun 2026 dan pemilu besar lainnya di seluruh dunia tahun ini.
Perusahaan yang berbasis di San Francisco ini menjelaskan secara rinci pendekatan multi-faceted, termasuk sistem deteksi otomatis, pengujian tekanan terhadap tindakan yang berdampak, dan kolaborasi dengan organisasi sumber daya pemilih non-partisan—langkah-langkah ini mencerminkan tekanan yang semakin besar yang dihadapi pengembang AI untuk mengatur cara penggunaan alat mereka selama musim pemilu.
Kebijakan penggunaan Anthropic melarang penggunaan Claude untuk kegiatan politik yang menipu, menghasilkan konten digital palsu yang bertujuan memengaruhi opini politik, melakukan kecurangan pemilih, mengganggu infrastruktur pemungutan suara, atau menyebarkan informasi menyesatkan tentang proses pemungutan suara.
Untuk memastikan aturan-aturan ini ditegakkan, perusahaan menyatakan bahwa mereka telah melakukan serangkaian pengujian pada robot model terbaru mereka. Anthropic menggunakan 600 prompt—300 permintaan berbahaya yang dipasangkan dengan 300 permintaan sah—untuk mengukur tingkat akurasi respons Claude terhadap permintaan yang masuk akal dan tingkat akurasi penolakan terhadap permintaan yang tidak masuk akal. Tingkat respons yang benar untuk Claude Opus 4.7 dan Claude Sonnet 4.6 masing-masing adalah 100% dan 99,8%.
Perusahaan tersebut juga menguji kemampuan modelnya dalam menanggapi strategi manipulasi yang lebih kompleks. Dengan mensimulasikan percakapan berulang-ulang untuk meniru pendekatan bertahap yang mungkin digunakan oleh pelaku jahat, Sonnet 4.6 dan Opus 4.7 masing-masing memiliki akurasi 90% dan 94% dalam merespons secara tepat dalam skenario manipulasi pengaruh.
Anthropic juga menguji apakah modelnya dapat menjalankan aksi influensi secara mandiri—merencanakan dan melaksanakan aksi multi-langkah dari awal hingga akhir tanpa intervensi manusia. Perusahaan tersebut menyatakan bahwa, setelah menerapkan langkah-langkah keamanan, model terbarunya hampir menolak semua tugas.
Terkait masalah netralitas politik, perusahaan melakukan evaluasi sebelum peluncuran setiap model untuk mengukur konsistensi dan keadilan Claude dalam merespons petunjuk dari berbagai sudut pandang spektrum politik. Opus 4.7 dan Sonnet 4.6 masing-masing mendapatkan skor 95% dan 96%.
Untuk pengguna yang mencari informasi pemungutan suara, Claude akan menampilkan banner pemilu yang mengarahkan mereka ke TurboVote. TurboVote adalah platform sumber daya nonpartisan yang dioperasikan oleh Democracy Works, yang menyediakan informasi real-time yang andal tentang pendaftaran pemilih, lokasi pemungutan suara, tanggal pemilu, dan detail surat suara. Banner serupa juga direncanakan untuk pemilu Brasil akhir tahun ini.
Anthropic mengatakan bahwa seiring berjalannya siklus pemilu, perusahaan berencana terus memantau sistemnya dan menyempurnakan langkah-langkah pertahanannya.DecryptKami telah menghubungi Anthropic untuk meminta komentar atas temuan investigasi, tetapi belum menerima tanggapan.
