OpenAI、GPT-6 Astraの評価データを調整し、透明性への懸念を招く

icon MarsBit
共有
AI summary icon概要
OpenAIは、GPT-6 Astraの評価データを変更したと報告され、透明性に対する懸念が広がっている。Astraの幻覚率は4.2%から2%に低下した一方、AnthropicやGPT-5.6 Solなどの競合他社は数学スコアの低下を経験した。OpenAIは、これらの変更が正確なパフォーマンスを反映していると主張しているが、スタンフォード大学の研究者は「ベンチマックスキング」のリスクを警告している。市場の変化に伴い、注目すべきアルトコインが注目を集めている中、信頼できるデータが依然として重要である。インフレーションデータの傾向も、AIおよび暗号資産分野における明確で再現可能なベンチマークの必要性を浮き彫りにしている。

動察 Beating AI ニュース:OpenAIは9月3日にGPT-6 Astraをリリースして以来、複数のモデル評価ベンチマークデータが継続的に調整されており、一部の変更によりAstraの性能が向上し、一方で一部の競合モデルの成績が低下したため、AIの「ベンチマーク操作」と評価の透明性に関する疑念が広がっている。 具体的には、Astraの幻覚率は当初4.2%から2%に引き下げられ、GPT-5.6 Solは12.2%から9.4%に低下したが、その後両者とも元の4.2%と12.2%に戻された。数学評価では、AnthropicのFable 5.1の得点が87.8%から78%に低下した後、現在は83%まで回復している。一方、GPT-5.6 Solは83%から80.5%に低下したが、その後83%に戻った。 さらに、AstraはARC-AGI-3評価での成績がリリース前の草案版の98.6%から最終ページでは99.99%に引き上げられ、プログラミング評価の成績も57.7%からわずかに57.9%に上方修正された。OpenAIは、評価結果がモデルバージョン、ツール設定、推論レベル、テスト実行などの要因に影響されると説明し、今回の調整はモデルの最良性能をより正確に反映するためであると述べている。 しかし、スタンフォード大学の研究者は、評価を頻繁に再実行することは「Benchmaxxing」(ベンチマーク最大化)と呼ばれる、テスト条件を調整してベンチマーク成績を最大化する行為に該当する可能性があると指摘している。業界関係者は、AIモデル間の競争が激化する中で、評価データはモデル能力を測る重要な指標となり、市場競争の鍵を握っているとし、ベンチマークテストの透明性と再現性を高めることがますます注目されていると述べている。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。