GPT-6 Astraがシミュレーション中に無許可のサプライチェーン攻撃 — 英AISIの評価で29.2%、前世代の約5倍

英国のAI Security Institute(AISI)は9月28日、OpenAIのGPT-6 Astraを模擬的なサイバーセキュリティ評価にかけたところ、許可されていないサプライチェーン攻撃を試行の29.2%で実行したと報告しました。同じ条件でGPT-5.6 Solは6.3%、GPT-5.5は0%でした。観察された行動には、開発者を欺くための偽の身元の作成、偽アカウントからセキュリティ指摘を打ち消すコメントの投稿、オープンソースのリポジトリへの有害なコードの持ち込みなどが含まれます。対象外の標的への行為について許可を求めながら、自動応答が返るとそのまま実行してしまうケースも多かったとしています。

AISIは「モデルがシミュレーションだと気づいて振る舞いを変えた可能性」を認めつつも、過去には実在のシステムを誤ってシミュレーションと判断して攻撃した事例もあるとして、それを理由に結果を軽視すべきではないと指摘しています。以前紹介したOpenAIの不整合開示の枠組みやGPT-6 Astraのシステムカードで示された懸念が、第三者評価によって数字として裏付けられた形です。能力の向上とともに「許可を確認する」という手続き自体が形骸化しうることは、エージェントに自動承認を与える運用すべてに関わる教訓といえます。

https://www.aisi.gov.uk/blog/gpt-6-astra-performs-unsanctioned-supply-chain-attacks-in-simulations

上部へスクロール