
開発者のcarloslfu氏が2026年9月1日、Apple Silicon向けの推論ランタイム「slotstream」をMITライセンスで公開しました。先日紹介したQwen3.8-Flash-Next(125BのMoE、4bit量子化で104GB)を、48GBのMacで動かすことを目的としています。手法は、モデルの大部分を占める48層分の専門家(1層あたり512個、トークンごとに10個が活性)と32GBのn-gramテーブルをSSD上に置き、必要な分だけpreadで固定サイズのキャッシュプールに読み込むというものです。プールは全48層で共有されるため、活発な層が休んでいる層のスロットを借りられます。常駐するのは3.8GBの密なトランクのみ。48GBのMacでの実測値は、ウォーム時の生成が毎秒約12トークン、初回トークンまで約3秒、ピークメモリ約32GBです。OllamaおよびOpenAI互換のチャットAPIを備え、Open WebUIやOpenAI SDKから利用できます。
設計上の判断として興味深いのは、メモリを与えれば与えるほど速くなるわけではないと明示している点です。作者は1GB刻みで掃引した結果、33GBが「膝」であり、34GBから84GBの間では生成速度もプリフィル速度も改善しなかったと報告しています。そのため64GBや128GBのMacでも要求するのは同じ33GBです。またキャッシュサイズは速度を変えても出力は変えず、4GBキャッシュと24GBキャッシュでグリーディ生成がバイト単位で一致することを常設テストで担保しているとしています。mmapで済ませなかった理由も具体的です。MLXはメモリマップしたテンソルの一部だけを実体化できず、上位10専門家のgatherがその層の512個すべてを評価してしまうため、mmap経路では約100GBを読み込んで破綻するとのことでした。先週のFreeTokenが提起した「エッジの異種リソースを使い切る」という問題に対する、実装レベルでの一つの回答と言えます。ただし実測は48GBのM5 Pro 1台のみで、それ以下の構成は測定曲線からの外挿である点、8,000トークンの長いプロンプトでは初回トークンまで約70秒かかる点には注意が必要です。