NVIDIA Groq 3 LPXが量産開始 — 推論の「体感速度」を上げる専用アクセラレータ

NVIDIAが2026年8月24日、Hot Chips 2026において推論専用アクセラレータ「Groq 3 LPX」の量産開始を発表しました。フラッグシップのVera Rubinプラットフォームを拡張する位置づけで、1ラックあたり最大256基を搭載します。狙いはトークン生成の速度、すなわち個々の利用者から見た応答の速さ(インタラクティビティ)の向上です。Artificial Analysisのベンチマークでは、Gemma 4 31Bを10万トークンのコンテキストで動かして毎秒3,400トークンの出力を記録したとしています。アーキテクチャ面では、HBMを持つRubin GPUと、SRAMを積んだLPU(言語処理ユニット)を組み合わせる構成です。最初の採用先はクラウド事業者のNebiusで、同社のToken Factory上で提供されます。

この発表が示すのは、推論が訓練とは別種のワークロードとして扱われ始めているということです。エージェントは一つのタスクを終えるのに数百から数千の推論ステップを重ねるため、総スループットよりも1ステップあたりの応答速度が体感を左右します。メモリ帯域の広いHBMと低レイテンシのSRAMを役割分担させる設計は、その要求に合わせた分業と言えます。金曜に紹介したFreeTokenが個人PCの異種リソースを使い切ろうとしていたのと、方向は逆ながら発想は似ています——推論の性質に合わせてハードウェアの構成を組み替える、という点です。なお、毎秒3,400トークンという数値は特定のモデルと条件でのものであり、Nebiusでの提供も現時点では計画段階です。数値をそのまま一般化しないよう注意が必要でしょう。

https://nvidianews.nvidia.com/news/nvidia-groq-3-lpx-now-in-full-production-with-world-class-speed-for-agentic-ai

上部へスクロール