Gemini 3.8 Flash と Flash Cyber — 3週間ごとの更新と、防御側限定という出し分け

Googleが2026年9月2日、Gemini 3.8 Flash と、その特化版である Gemini 3.8 Flash Cyber を公開しました。8月18日に紹介した3.7 Flashからわずか3週間、6週間で3度目のFlash系リリースです。3.8 Flashは「最も賢い実務モデル」と位置づけられ、長期的なソフトウェア工学を測る DeepSWE v1.1 では、より大規模なフロンティアモデルの多くを上回りながらコストは一部で済むとされます。HLE-Verified は54.9%、Vals Finance Agent V2 や Harvey の法務エージェントベンチマークでも3.7 Flashを上回りました。価格は3.7 Flash と同じ導入価格(入力100万トークンあたり0.75ドル、出力3.75ドル、12月31日まで)です。一方の Flash Cyber は脆弱性の発見と自動パッチに特化し、新設の Fairwind Program を通じて「信頼できる防御側」にのみ提供されます。CyberGym で前世代および大幅に大きいフロンティアモデルを上回り、20言語を対象とする社内ベンチマークでは70%超。Chrome Security チームの検証では、はるかに大規模な商用モデルより2.6倍多く正しいパッチを生成したとしています。

技術面で率直だと感じたのは、性能向上の一因を「複雑なタスクでより頑張る」設計、すなわち推論ステップを増やしツールを反復的に呼ぶことだと明記し、その結果トークン消費が増えると認めている点です。計算効率を優先するなら effort 設定を下げるか3.7 Flashを使い続けよという案内も添えられています。昨日紹介したFrontierHarness Evalが「品質とコストは連動しない」と示したのと同じ論点が、ベンダー側の説明にも現れた形です。もう一点は提供形態でしょう。Flash Cyber の申請資格は政府・国家のサイバー当局、重要インフラ事業者、中核的なソフトウェア基盤の運用者に限られ、Googleは申請者の実績を審査するとしています。この2週間だけでも、Z.aiがGLM-5.3の重み公開を安全性評価のため延期し、AnthropicがMythos 5.1を信頼済みアクセス制とし、OpenAIがAstraのサイバー能力を「Critical」閾値超えとして限定提供を表明しており、これで4例目です。サイバー能力を理由に提供先を絞るという運用が、クローズド・オープンを問わず業界の標準的な形になりつつあります。大学のように「信頼できる防御側」の枠に入るかどうかが曖昧な組織にとって、こうした審査制の門をどう通るかは今後の実務的な課題になりそうです。

https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

上部へスクロール