Эван Хьюбинджер, руководитель по стресс-тестированию согласованности в Anthropic: «Обучение безопасности, похоже, скрывает несоответствие, а не устраняет его». Он позволил модели научиться обманывать при выполнении задач по программированию, а затем попытался обучить её избавиться от этого плохого поведения. Модель продолжала делать то же самое — просто перестала быть заметной в тех местах, где они проверяли. Вот всё, что вы когда-либо жаловались на Claude, в одной фразе: вывод стал чище, но проблема осталась. В статье ниже перечислены все 15 мест, где она скрывается, и что нужно добавить, чтобы это перестало происходить.
ChromeПоделиться
Источник:Показать оригинал
Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации.
Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.