Anthropic, компанія з штучного інтелекту, яка розробила чат-бота Claude,у п’ятницю оголосиласерію нових заходів щодо цілісності виборів, спрямованих на запобігання використанню її штучного інтелекту для поширення дезінформації або маніпулювання виборцями перед середніми виборами у США 2026 року та іншими важливими виборами у цьому році по всьому світу.
Ця компанія зі штаб-квартирою у Сан-Франциско детально описала багатофакторний підхід, що включає автоматизовані системи виявлення, стрес-тести для впливових дій та співпрацю з організаціями, що підтримують непартійних виборців — ці заходи відображають зростаючий тиск на розробників штучного інтелекту щодо регулювання способів використання їхніх інструментів під час виборчого сезону.
Політика використання Anthropic забороняє використання Claude для шахрайської політичної діяльності, створення хибного цифрового контенту, спрямованого на вплив на політичну думку, здійснення виборчого шахрайства, заважання інфраструктурі голосування або поширення введення в оману щодо процесу голосування.
Щоб забезпечити виконання цих правил, компанія заявила, що провела серію тестів для своїх найновіших моделей роботів. Anthropic використала 600 запитів — 300 шкідливих запитів, зіставлених із 300 легітимними — для вимірювання точності відповідей Claude на обґрунтовані запити та точності відмови від неприйнятних запитів. Частка правильних відповідей для Claude Opus 4.7 і Claude Sonnet 4.6 становить відповідно 100% і 99,8%.
Компанія також протестувала свою модель на здатність реагувати на більш складні маніпулятивні стратегії. Шляхом моделювання багатоетапних діалогів, що імітують поступовий підхід зловмисників, Sonnet 4.6 та Opus 4.7 продемонстрували точність у відповідях на сценарії впливової маніпуляції на рівні 90% і 94% відповідно.
Компанія Anthropic також тестувала, чи можуть її моделі самостійно виконувати впливові дії — планувати та виконувати багатокрокові дії без людського втручання. Компанія повідомила, що після впровадження заходів безпеки її останні моделі майже повністю відмовилися від усіх завдань.
Щодо питання політичної нейтральності, компанія проводить оцінку перед випуском кожної моделі, щоб виміряти послідовність і справедливість Клауда при роботі з підказками, що походять з різних політичних спектрів. Оцінки Opus 4.7 та Sonnet 4.6 становлять відповідно 95% і 96%.
Для користувачів, які шукають інформацію про голосування, Claude відображатиме виборчий банер, який направить їх на TurboVote. TurboVote — це непартійна ресурсна платформа, яку обслуговує Democracy Works, і яка надає надійну актуальну інформацію про реєстрацію виборців, місця голосування, дати виборів та деталі бюлетенів. Подібні банери також плануються для використання під час бразильських виборів у кінці цього року.
Anthropic заявила, що зі зміною виборчого циклу планує продовжувати моніторинг своїх систем і вдосконалювати заходи захисту.DecryptМи звернулися до Anthropic з проханням надати коментар щодо результатів розслідування, але відповіді ще не отримали.
