
PrismMLが2026年9月17日、三値量子化モデル「Ternary Bonsai 2 27B」をApache 2.0ライセンスで公開しました。Qwen3.8 27Bを基にした270億パラメータの多モーダルモデルで、重みを{−1, 0, +1}の三値にFP16のグループ単位スケーリングを組み合わせ、1重みあたりの実効ビット数を1.76ビットまで下げています。モデル全体の容量は5.9GBで、full precision版と比べて9倍以上小さい一方、ベンチマークの総合性能は98.2%を保ち、スイート全体のスコアは83.9でした。文脈長は262,144トークン、入力はテキストと画像に対応します。動作環境はCUDA経由のNVIDIA GPUに加え、MLX経由でMac・iPhone・iPadでも動きます。以前紹介した初代Bonsai 27Bからの改善点は、基盤モデルがより強力になったことと、性能維持率が95%から98.2%に上がったことで、推論・コーディング・視覚・長期のエージェント動作が向上したとしています。
三値量子化の面白さは、重みが実質的に「引く・何もしない・足す」の三択になる点にあります。乗算がほぼ不要になるため、行列演算の重い部分がGPUの専用ユニットに依存しにくくなり、消費者向けCPUやエッジGPUでも現実的な速度が出ます。5.9GBという容量は、当部門で紹介してきたローカル実行の話題——Apple M5 Ultraの512GBユニファイドメモリや、125BのMoEを48GBのMacで動かすslotstream——と比べると桁違いに小さく、手元の端末にそのまま載る水準です。注目したいのは、性能維持率を95%から98.2%へ詰めてきた点で、「小さくすると賢さが落ちる」という前提が量子化手法の改良で削られ続けていることを示しています。Apache 2.0で重みが公開されているため、学内の端末で検証するにも障壁がありません。