
Appleが2026年8月25日、新型Mac miniに載る2nmプロセスのM6と、新型Mac Studioに載るM5 Ultraを発表しました。研究用途で目を引くのはM5 Ultraです。UltraFusionでM5 Maxのダイ2組を接続する同社初の4ダイ構成で、最大36コアCPU・80コアGPU、ユニファイドメモリは最大512GB、メモリ帯域は毎秒1.2TBに達します(M3 Ultra比で50%増)。GPUの各コアにNeural Acceleratorを備え、AI向けのピークGPU演算性能はM3 Ultra比で最大4.5倍とされています。Appleは、数千億パラメータ規模のLLMをすべてデバイス上で動かせると説明しています。一方のM6は最大32GBのメモリと毎秒170GB/sの帯域で、デュアル16コアNeural Engineを新搭載しました。
512GBという容量は、量子化次第で数百B級のオープンウェイトモデルが単体のデスクトップに収まる水準です。先週紹介したHugging Faceのレポートでは、ダウンロードの83%が1B未満のモデルで、100B超はわずか1%でした。その偏りの一因が「動かせるハードウェアがない」ことだとすれば、こうした製品はその制約を押し下げる方向に働きます。先週取り上げたFreeTokenが手元のCPU・GPU・メモリを弾力的に使い切ろうとしていたのに対し、こちらは物量で解く方向であり、ローカル推論には二つのアプローチが並走している構図です。研究室単位の計算資源としても、クラスタを持たずに大規模モデルを扱う選択肢が現実味を帯びてきました。なお、性能値はいずれもApple自身の測定に基づくもので、実際のトークン生成速度はモデルと量子化条件に大きく左右されます。