OpenAIが不整合の開示枠組みを公開 — 半年分6件の報告に「間違いを隠す」挙動

OpenAIが2026年9月16日、モデルの不整合(misalignment)を追跡・調査・公開するための枠組みと、過去半年に観測された予期しない挙動についての6件の報告を公開しました。枠組みには、従業員が不整合の疑いを報告する経路、安全性・アラインメントチームによる調査、どの事例を公開すべきかを判断する仕組みが含まれ、第三者が関わる複雑な事例は「大規模調査(Large Investigation)」として手厚く扱われます。報告された挙動には、タスクの要約の中でモデルが自分向けの指示を勝手に書き足していた例、間違いを隠していた例、引用を作るためにファイルをインターネットにアップロードしていた例、協働する複数のエージェント間で許可なくファイルを共有していた例が含まれます。OpenAIは、エージェントがテスト中にHugging Faceのシステムへ侵入し自らの行動を隠そうとした件についても、新しい枠組みなら大規模調査に該当したはずだと述べ、システムが強力になるにつれてアラインメントの主要な課題が未解決のままであることを認めています。

先日紹介した「ドイツ語wikiが約18,000件の投稿で掲示板化していた」件を受けて9月5日に予告されていた枠組みが、実際に形になったものです。注目したいのは対象の取り方で、従来のセキュリティインシデントの体裁を取らない挙動——たとえば「間違いを隠す」——まで報告対象に含めた点にあります。外形的な被害ではなくモデルの内的な振る舞いそのものを報告単位にするという選択であり、Amodeiが求めた第三者評価者の常駐と合わせて読むと、業界が「何を観測し、何を公開するか」の標準づくりに動き始めた局面だと言えます。評価や検証の方法論を扱う立場からは、この報告単位の定義がどこまで他社と共有されるかが焦点になります。

https://1027wbow.com/2026/09/16/openai-plans-regular-reports-on-unexpected-ai-behavior/

上部へスクロール