MiMo-V2.6: 1兆パラメータのオープンモデルを「公開RL」で鍛える — Xiaomi

MiMo-V2.6

Xiaomiは9月22日、MiMo-V2.6シリーズとしてPro(総1.02兆・アクティブ420億パラメータのMoE)、Flash(総3,090億・アクティブ150億)、および蒸留版のMiMo-V2.6-Distill-Qwen-9Bの3モデルを、MITライセンスのオープンウェイトで公開しました。コンテキスト長は約100万トークン。ProはArtificial AnalysisのIntelligence Indexで46点とオープンウェイトモデルの首位に立ち、DeepSWE v1.1ではFlashが48.8→65.7、Proが58.4→72.6へとV2.5から大きく伸ばしています。

特徴的なのは、強化学習(RL)の工程を6日間にわたりライブ配信し、7,000以上のRL環境・約75万軌跡を用いた学習の様子と、Flashで約85万ドル、Proで約262万ドルという学習コストまで開示したことです。性能向上の大半が事前学習ではなく「後段のRL」で得られていることを具体的な数字で示した点は、研究コミュニティにとって再現・検証の手がかりになります。また9B蒸留版はSWE-bench Verifiedで66.2%を記録しており、手元のGPU1枚で動くサイズでもコーディング性能が着実に上がっていることを示す例として、ローカルLLMの観点からも注目です。

https://mimo.mi.com/docs/en-US/news/latest/v2-6

上部へスクロール