
AlibabaのQwenチームが2026年8月26日、次世代Qwen4のアーキテクチャを先行公開する実験モデル「Qwen3.8-Flash-Next」をオープンウェイトで公開しました。バックボーン125Bに51BのN-gram埋め込みテーブルと4Bのマルチトークン予測モジュールを加えた構成で、ディスク上は約180Bになりますが、1トークンあたりに動くのは6Bだけです。512個のエキスパートから10個+共有1個だけを通すMoEに加え、線形アテンションのGated DeltaNetを4層中3層に使いQwen Sparse Attentionと混ぜるハイブリッド注意機構、4分岐のGated Residual、2,000万エントリのN-gram埋め込み、Muonオプティマイザといった変更が入っています。ネイティブ262,144トークン、YaRNで100万トークンまで拡張可能。ライセンスはApache-2.0ではなくqwen-community-1.0です。
先日紹介したGLM-5.3-Flash(320B総/18B活性)と同じ週に、Qwenは活性パラメータをさらに絞った6Bで出してきました。学習コストはQwen3.7-Plusの約9分の1と報告されており、規模を増やすのではなくアーキテクチャで効率を稼ぐ方向が鮮明です。当部門が注目してきたローカル実行の観点では、FP8チェックポイントが約173GiBと依然として重い一方、llama.cppやvLLM、SGLangが公開初日から対応しており、置き場所さえ確保できれば実計算量は6B級で回るという点が実用上の分かれ目になります。