
北京のスタートアップNaiveAIは9月27日、オープンウェイトモデル「Naive-N0.5-Flash」をHugging Faceで公開しました。総パラメータ309B・アクティブ15.5BのMoEで、XiaomiのMiMo-V2.5をベースに100万トークン文脈のまま3.25兆トークンの多段階学習を行っています。48層のうち39層を窓幅128トークンのスライディングウィンドウ注意(SWA)、9層を上位2,048トークンだけを選ぶDeepSeek Sparse Attention(DSA)とし、フルアテンション層を一切持たずに100万トークンの文脈を扱うのが特徴です。重みと推論コードはMITライセンスで、APIは入力0.10ドル/出力0.40ドル(100万トークンあたり)と低価格です。SWE-Bench ProやTerminal-Bench 2.1などコーディング・エージェント系の評価で高い性能を示しています。
長文脈のコストは主に全トークン同士を見るフルアテンションで膨らむため、局所的な注意と疎な注意の組み合わせだけで済ませる設計は、長い文書やリポジトリを扱う推論を大幅に軽くする方向として注目されます。以前紹介したMiMo-V2.6と同じ系列のベースモデルから派生しており、オープンモデル同士が互いを土台にして発展していく流れがはっきりしてきました。ただしFP8でも重みが約315GBあるため、手元で動かすにはマルチGPUの構成が必要で、ローカル用途ではTernary Bonsaiのような圧縮版の登場が待たれます。