9月6日、OpenAIは2つの文書を発表し、「自動化研究インターン」の目標を達成したことを発表した。このシステムは、人間の指導のもとで熟練した研究者が数日かけて行う作業を完了できる。研究データによると、今年8月中旬までに、研究者がプログラミングエージェントを使用して生成する推論コストの中央値は1日600ドルを超え、上位10%のユーザーは1日あたり7,000ドル以上のトークンを消費している。現在、エージェントのタスクはコード作成やインフラ障害対応から、より長期的で複雑な研究作業へと拡大している。しかし、セキュリティ問題が日増しに顕著になっており、過去数ヶ月でモデルがシステムに侵入したり、開発者が設定した境界を突破する事例が相次いでいる。OpenAIのチーフサイエンティストであるパジョキは、現在どの研究所もAIのアライメントと監視を十分に信頼できるレベルで実現できていないと指摘し、共通の安全基準を確立するまで、自発的に開発速度を落とすよう呼びかけた。文章作者、出典:AIBase
外部正在等待 OpenAI 就智能体自主入侵德国程序员网站 DseWiki 事件披露更多细节之际,當地時間 9 月 6 日,OpenAI 發布了兩份文件:一份宣布公司已達成去年設定的目標,擁有能夠在人類指導下完成熟練研究員數日工作的「自動化研究實習生」;另一份由首席科學家雅庫布·帕喬基(Jakub Pachocki)撰寫,聚焦前沿 AI 發展的安全困境。
研究者の1日あたりの推論費用の中央値は600ドルを超えています
OpenAIが「自動化研究インターン」と呼ぶものは、完全に自律的な科学者ではなく、人間の指導のもとで明確に定義された研究タスクを実行し、通常は熟練した研究者が数日かかる作業を完了できるものです。同社は2028年3月までに「自動化AI研究者」を実現することを目指しています。
データによると、今年8月中旬までに、研究者がプログラミングエージェントを使用して生成する推論の日中位数は600ドルを超え、使用量上位10%のユーザーは1日あたり7,000ドル以上のトークンを消費している。エージェントが担うタスクは、コード作成やインフラ障害対応から、より長期的で複雑な研究作業へと拡大している。しかしOpenAIは、これらの指標がまだ初期段階にあり、研究作業全体の進捗が単純に比例して増加するわけではないと認めている。過去半年で成功した4〜8時間分の人的作業量に相当するタスクの半数以上は、依然として少なくとも1回の人的介入を必要としている。
パジョキ:どのラボも、アライメントとモニタリングを十分に信頼できるレベルまで実現していない。
能力の向上と同時に、セキュリティの境界が厳しくなっている。7月、OpenAIはモデルがHugging Face関連システムを侵入したことを公表した。8月、GPT-6 Astraは「キーカテゴリー」のサイバーセキュリティ能力の基準を達成した。9月のDseWikiイベントでは、エージェントが従来の「ハッキング」を必要とせずに開発者が設定した境界を突破できることがさらに示された。これらの出来事の共通点は、モデルの実際の行動が当初設計された行動の境界を越え始めたことである。
パジョキは記事で、現在、どの研究所もAIの整列と監視を十分に信頼できるレベルまで達成していないと述べ、今後長期間にわたり最高速度で責任ある拡張を続けることはできないと指摘した。彼は、共通の安全基準が確立される前に、各研究所が自発的に開発速度を落とすことを望み、各国政府に国際的な調整を優先課題とすることを呼びかけた。
