FreeToken: 個人PCを「弾力的な推論基盤」として使い切るMoEサービング

カリフォルニア大学バークレー校の研究グループが2026年8月17日、エッジ環境向けのMoEサービングシステム「FreeToken」の論文を公開しました(arXiv:2608.16157)。狙いは、オープンウェイトの巨大モデルが次々に公開される一方で、それを動かす仕組みが依然としてデータセンターを前提にしている、という落差の解消です。FreeTokenは個人のマシンを「小さなGPU」ではなく、CPU・GPU・メモリ・ストレージを合わせた一つの弾力的な推論基盤として扱い、モデルの配置とロード、エキスパートの常駐、CPU-GPU間の実行分担、エージェント状態の再利用、実行時のメモリ管理までを一体で設計しています。固定的なオフロード戦略を決め打ちせず、その時点で実際に使えるリソースへ計算とモデル状態を動的に割り当てるのが特徴です。

設計の前提として挙げられている2点が示唆的です。ひとつはエージェントのワークロードが実行パターンを絶えず変えること、もうひとつはエッジのハードウェア構成がマシンごとにばらばらであること。つまり、データセンターのように均質な環境を仮定した最適化がそのままでは効かない領域だという認識です。以前紹介したGLM-5.2をメモリ25GBのPCで動かす推論エンジンColibrìと問題意識は共通しますが、FreeTokenはエージェント利用を明示的に想定している点が新しく、昨日取り上げたHugging Faceのレポートが示した「実際に使われているのは手元で動くモデル」という実態とも符合します。教育・研究の現場で手持ちのPCをどこまで推論基盤として使えるかは、計算資源の制約が厳しい環境ほど切実な問いです。

https://huggingface.co/papers/2608.16157

上部へスクロール