DeepSeek-V4-Flash-Vision-Exp: 305Bのマルチモーダルモデルを静かにMITライセンスで公開

DeepSeekが2026年8月31日、Hugging Face上にDeepSeek-V4-Flash-Vision-Expを公開しました。V4-Flashのアーキテクチャに視覚エンコーディングを加えた3,050億パラメータの実験的マルチモーダルモデルで、ライセンスはMITです。モデルカードによれば、マルチモーダルエージェント性能はV4-Flash-0731から大きく伸びており、ApexBench Pass@1が26.2から36.5、Agents Last Exam が25.2から27.3。テキストのみのエージェント性能は同程度で、Terminal Bench 2.1が83.9、DeepSWEが59.3とされています。重みはvLLMとSGLang向けのサービングレシピ付きで配布され、V4系列初の視覚モデルとして、マルチモーダルエージェントのベンチマークでOpus 4.8に対抗するオープンウェイトの選択肢という位置づけです。

目を引くのは公開の仕方です。発表イベントもプレスリリースもなく、Hugging Faceにモデルカードと重みが置かれただけでした。8月28日にTencentが770BのHy4-previewをApache 2.0で、26日にZ.aiがGLM-5.3-Flashを公開しており、大規模なオープンウェイト公開が日常の出来事になりつつあることの表れとも言えます。ただし3,050億パラメータという規模は、先週紹介したHugging Faceのレポートが示した実際のダウンロード分布(1B未満が83%、100B超は1%)からすれば、そのままでは大半の利用者の手には余ります。量子化やllama.cppを介した配布、あるいはApple M5 Ultraのような大容量メモリ環境が、公開と実利用の間を埋める役回りを担うことになりそうです。なお、記載された性能値はいずれもモデルカード上のもので、第三者による検証はこれからです。

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

上部へスクロール