仕様書を「小さなニューラル関数」にコンパイルする — Compile by Training

ウォータールー大学とハーバード大学の研究者が2026年9月4日、自然言語の仕様を再利用可能なニューラル関数に変換する手法「compile by training」を発表しました(arXiv:2609.04199)。問題意識は明快です。頻繁に呼び出す小さなテキスト処理は、言葉で書くのは簡単でもルールとして実装するのは難しい。かといって入力のたびに巨大な遠隔モデルを呼べば、費用と遅延と提供事業者への依存が積み上がります。提案手法では、コンパイル時に教師モデルが仕様に沿った例を生成し、それを使って小さなインタプリタ向けのアダプタを訓練します。出来上がった関数は教師モデルなしで動作し、通常のソフトウェアと同じく保存・バージョン管理・合成が可能です。高速なコンパイラ(Program-as-Weights)が完全一致を一つも出せなかったFuzzyBench-Hardにおいて、本手法は83.6%の意味的正答率に達しました。代償はコンパイル時間で、数秒ではなく約1分かかります。

論文の言い方を借りれば、これは大規模モデルを実行時の依存先ではなく「道具を作る側」に置く発想です。適応がソフトウェアのビルド工程になる、という整理は当部門の関心に近いところがあります。9月4日に紹介したRepo-To-Skillがリポジトリを技能に蒸留していたのと方向は同じで、こちらは仕様書を出発点にしている点が違います。9月3日のFrontierHarness Evalは同じモデルでもハーネス次第でタスク単価が17倍変わることを示しましたが、そもそも毎回フロンティアモデルを呼ぶ必要があるのか、という問いを立てているのが本手法です。研究・教育の現場では、定型的なテキスト処理(書式の統一、メタデータの抽出、分類など)を学内で完結させたい場面が少なくありません。一度コンパイルすれば外部APIに依存せず、バージョン管理もできる成果物になるという性質は、そうした用途と相性がよさそうです。なお本論文は査読前のプレプリントで、評価はFuzzyBenchという特定のベンチマーク上のものです。判定にGPT-5.5を用いた意味的正答率である点にも留意が必要でしょう。

https://arxiv.org/abs/2609.04199

上部へスクロール