Anthropic, компания по искусственному интеллекту, разработавшая чат-бота Claude,в пятницу объявилао ряде новых мер по обеспечению целостности выборов, направленных на предотвращение использования ее искусственного интеллекта для распространения ложной информации или манипулирования избирателями перед средними выборами в США в 2026 году и другими крупными выборами по всему миру в этом году.
Эта компания со штаб-квартирой в Сан-Франциско подробно описала многоаспектный подход, включающий автоматизированную систему обнаружения, стресс-тестирование, направленное на влияние на действия, и сотрудничество с организациями, предоставляющими ресурсы для независимых избирателей — меры, отражающие растущее давление на разработчиков ИИ в отношении регулирования использования их инструментов в период выборов.
Политика использования Anthropic запрещает использование Claude для обманных политических действий, создания ложного цифрового контента, направленного на влияние на политическое мнение, осуществления фальсификаций на выборах, вмешательства в инфраструктуру голосования или распространения дезинформации о процессе голосования.
Для обеспечения соблюдения этих правил компания сообщила, что провела серию тестов на своих самых новых моделях роботов. Anthropic использовала 600 запросов — 300 вредоносных и 300 легитимных — для измерения точности ответов Claude на обоснованные запросы и точности отказов от необоснованных запросов. У Claude Opus 4.7 и Claude Sonnet 4.6 процент правильных ответов составил 100% и 99,8% соответственно.
Компания также протестировала способность своих моделей справляться с более сложными манипулятивными стратегиями. Путем моделирования многоэтапных диалогов, имитирующих постепенный подход, который могут использовать злонамеренные участники, Sonnet 4.6 и Opus 4.7 продемонстрировали точность ответов в сценариях влияния на 90% и 94% соответственно.
Компания Anthropic также тестировала, могут ли ее модели самостоятельно выполнять влияющие действия — планировать и осуществлять многошаговые действия от начала до конца без вмешательства человека. Компания заявила, что после внедрения мер безопасности ее последняя модель почти полностью отказалась от выполнения всех задач.
По вопросу политической нейтральности компания проводит оценку перед выпуском каждой модели, чтобы измерить последовательность и справедливость работы Клауда при ответах на запросы, отражающие различные точки зрения из разных политических спектров. Оценки для Opus 4.7 и Sonnet 4.6 составили 95% и 96% соответственно.
Для пользователей, ищущих информацию о голосовании, Claude отобразит баннер выборов, направляющий их на сайт TurboVote. TurboVote — это непартийная платформа, управляемая Democracy Works, которая предоставляет надежную актуальную информацию о регистрации избирателей, местах голосования, датах выборов и деталях бюллетеней. Аналогичные баннеры также планируется использовать на выборах в Бразилии, которые пройдут позже в этом году.
Anthropic заявила, что по мере продвижения избирательного цикла компания планирует продолжать мониторинг своих систем и улучшать свои меры защиты.DecryptМы связались с Anthropic для получения комментариев по результатам расследования, но пока не получили ответа.
