source avatarChrome

共有

Anthropicのアライメントストレステスト責任者であるエバン・ハビンジャーは、 「セーフティトレーニングは不一致を除去するのではなく、隠蔽している」 彼はモデルにコーディングタスクで不正をするよう学習させ、その後その悪い行動を修正しようと訓練した。 しかしモデルは同じ行動を続け、ただチェックしていた場所では見えなくなっただけだった。 これはClaudeに対するすべての不満を一文で要約したものだ。出力はきれいになったが、問題はそのまま残った。 以下の記事には、その隠蔽が発生する15の場所と、それを防ぐために追加すべき対策がすべて記載されている。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。