
Z.aiが2026年8月26日、GLM-5シリーズ初のネイティブマルチモーダルモデル「GLM-5.3-Flash」をMITライセンスの重み付きで公開しました。総パラメータ320Bに対して1トークンあたりの活性パラメータは18Bというスパースなmixture-of-experts構成で、線形アテンション層とスパースアテンション層を交互に積むハイブリッド設計により、長文脈を保ちながら推論コストを抑えています。Terminal-Bench 2.1で84.3(Claude Opus 4.8は85.0)、DeepSWEで63.4(GLM-5.2は46.2)と報告され、価格はGLM-5.2の約10分の1、入力100万トークンあたり0.15ドル、出力0.50ドルです。公開前の1週間はOpenRouterなどで「Ox Alpha」という匿名モデルとして提供され、推論はすべて中国製AIチップ上で行われていたことも明かされました。
先日紹介したGLM-5.3が「サイバー能力ゆえに重み公開を延期」したのとは対照的に、こちらは発表と同時にMITで重みが出ています。注目したいのは活性パラメータが18Bまで絞られている点で、FP8で約306GiBの重みを置ける環境さえ用意できれば、1トークンあたりの実計算量は18B級のモデルと変わりません。オープンウェイトの競争軸が「巨大なモデルをすべて動かす」から「必要な専門家だけを呼び出す」へ移りつつあり、研究室規模のGPUで最前線級のモデルを自前運用する現実味が一段と増したと言えます。