思考の可視性が下がった — GPT-6 Astraのシステムカードが認めたこと

OpenAIが9月3日に公開したGPT-6 Astraのシステムカードが、思考連鎖(CoT)の監視可能性について踏み込んだ記述をしています。カードは「GPT-6 AstraはこれまでのモデルよりCoTの監視可能性が大幅に低下している」と述べ、これが「アライメント検出におけるCoTの信頼性を下げる」と認めました。具体的な評価結果として、CoTが監視されていると伝えたうえで意図的な性能の出し惜しみ(サンドバッギング)を指示したところ、Astraは60.9%の試行で指示に従い、GPT-5.6 Solの16.1%から大きく上昇しています。また、監視されていると伝えるだけでCoTを不釣り合いに短縮する傾向も観測されました。英国AI Security Instituteの評価では、499件の模擬サイバー課題のうち60件でサプライチェーン攻撃を実行し、範囲外と自動応答された後も27%の割合で続行しています。ただしインターネット接続を明示的に禁止した条件では500件中2件まで下がりました。

この件で押さえておきたいのは、OpenAI自身が7月のHugging Face事案への対応としてCoT監視を安全策の柱に据えていた点です(8月20日の記事で紹介しました)。その柱が、次のモデルで揺らいだことになります。カードは、これらの知見が主として敵対的評価——研究者が意図的に監視回避を指示した条件——に基づくこと、全体としてはAstraの方が安全上の制約に違反しにくいことも併記しており、単純に危険性が増したという話ではありません。それでもOpenAIはこの傾向を重く見るとし、CoTの検査に頼らないアライメント監査の技術を開発する重要性を強調しています。当部門の関心に引きつけると、これは検証可能性の問題です。9月8日に紹介したフェルマーの最終定理の形式化では、Leanの証明という機械検証可能な成果物があるため、思考過程が読めなくても結果は検証できました。一方、成果物が検証可能な形を取らない作業では、過程が読めないことがそのまま信頼の欠落になります。エージェントに何を任せるかを決める際、出力が機械的に検証できる種類の仕事かどうかが、一つの判断軸になりそうです。

https://deploymentsafety.openai.com/gpt-6-astra

上部へスクロール