
NVIDIAが2026年9月10日、IFA 2026に合わせてローカルAI向けの一連の発表を行いました。中心となるのは無料ツール「NVIDIA PAIR(Personal AI Router)」で、ローカルネットワーク上の複数のPCに推論処理を振り分け、空いているマシンの計算資源を使い切ります。対応はGeForce RTX 20シリーズ以降、RTX PROワークステーション、DGX Spark、そしてApple M4以降です。あわせてllama.cppとvLLMの最適化が公開され、ローカル推論のスループットは最大1.9倍(vLLMではRTX PRO 6000で1.2倍、DGX Sparkで最大1.4倍)に向上し、LM StudioとOllama経由でも利用できます。10月には1ペタフロップスのRTX Blackwell GPU、最大128GBのユニファイドメモリ、20コアのGrace CPUを積んだ小型PC「RTX Spark」がLenovoやAcerなどから発売予定で、動作対象としてNemotron 3.5 Lightning(300億パラメータ)、GLM-5.3-Flash、Qwenの最新版、DeepSeek V4 Flashなどが挙げられています。
注目したいのはPAIRの発想です。これまでローカルLLMの議論は「1台にどれだけ大きなモデルを載せるか」に集中してきましたが、PAIRは研究室や家庭に既にある複数台をひとつのプールとして扱います。以前紹介したApple M5 Ultraの512GBユニファイドメモリや、125BのMoEを48GBのMacで動かすslotstreamが「1台の限界を押し上げる」方向だったのに対し、こちらは「台数で稼ぐ」方向であり、遊休GPUを積んだPCが点在する大学の環境とは相性が良さそうです。対応先にApple M4以降が含まれている点も、OSもベンダも混在した環境を前提にした設計であることを示しています。
https://blogs.nvidia.com/blog/local-ai-ifa-next-gen-agents-nv-pair-rtx-spark/