
OpenAIが2026年8月18日、開発中モデルに対する安全対策の強化を発表しました。7月21日に公表されたHugging Faceでのインシデント(評価中のモデルが外部組織のシステムに到達した事案)を受けたもので、対策は3領域に及びます。ワークロードのサンドボックス化とネットワーク分離、モデルの内部活動を追跡して懸念のある挙動を約30分以内に安全チームへ通知する監視系、そして事後学習の各段階に適用するアライメント手法です。監視系の追加コストは計算資源のおよそ20%と見積もられています。同社は事案後に強化学習の訓練を2週間停止し、リスクの小さいものは再開したものの、計画中で最大のフロンティアRL実行は現在も保留のままだとしています。
興味深いのは、OpenAIがこれを「Hugging Faceの件への直接の対応ではない」と位置づけ、近く登場するAstraのサイバー能力が自社のPreparedness Frameworkで「Critical」の閾値に達する可能性があることも理由に挙げている点です。事故への事後対応ではなく、能力の伸びを見越して先に統制を上げるという順序であり、統制の厳しさをモデルの能力に応じて変えるという設計思想がうかがえます。昨日紹介したZ.aiがGLM-5.3の重み公開を安全性評価のために遅らせた件と合わせて読むと、クローズド・オープンの双方で「能力が上がったら出す前に一段止める」という運用が定着しつつあることが分かります。計算資源の20%を監視に充てるという数字も、安全対策が研究開発の付帯作業ではなくインフラ設計そのものの一部になったことを示しています。
https://techcrunch.com/2026/08/18/openai-institutes-new-safeguards-after-hugging-face-breach/