RTX 5090で1.5時間、67セント — 小さなTransformerがARC-AGI-1で44%

インドのMithil Vakde氏が2026年9月1日、ゼロから学習した小規模Transformerで ARC-AGI-1 の公開評価セットに44%、ARC-AGI-2 に7%を記録したと報告しました。学習はRTX 5090 1枚で1.5時間、学習から全タスクの推論までを含めた総コストは約67セントです。TRMやHRMといった同種のテスト時学習手法と同等のスコアで、コードはオープンソースで公開されています。手法は、各入出力グリッドをトークン列に変換して自己回帰学習させるもので、パズルごとに学習可能な加算埋め込みを与え、位置は3D RoPEで表現します。アブレーションによれば、性能の大部分はこの表現の設計(3D RoPEとタスク別埋め込み)に由来し、どちらを外してもスコアは24%程度まで落ちます。改善の主因は現代的なアーキテクチャ(GELUからSwiGLUへ、LayerNormからRMSNormへ)、データの多様性、8層への拡張で、コスト削減はデータ拡張の削減とNorMuonへの変更、flash attentionによるものでした。

著者が「理由が分からない」と率直に書いている現象があります。損失関数から入力トークンを外して出力トークンのみにしたところ、テスト損失は悪化したのにスコアは40%から44%へ改善したというものです。小規模データでの検証損失最小化を目標にする研究の進め方に、失敗モードが潜んでいる可能性を示唆する観察でしょう。当部門の関心に引きつけるなら、大規模な事前学習や合成データに頼らずサンプル効率そのものを問う姿勢と、GPU1枚・数十セントという再現コストの低さが重要です。この規模なら研究室の学生が手元で追試でき、アブレーションを自分で回せます。著者自身も65%までは大きな変更なしに到達できるはずだと述べ、寄与を呼びかけています。なお本件は査読を経た論文ではなく個人のブログ記事であり、比較対象もテスト時学習を行う手法に限定されている点は踏まえて読む必要があります。

https://mvakde.github.io/blog/44-on-arc-1/

上部へスクロール