
Peter Kirgisら24名の研究チームが、フロンティアAIエージェントに未発表論文の中心的な研究課題そのものを解かせ、その論文の著者本人に採点させる「shadow evaluation(影の評価)」という枠組みを提案しました。NeurIPS 2026に投稿中の2本を対象に、6日間とインターネットアクセス、数千ドル規模の計算資源をエージェントに与えたところ、いずれの成果も原著者から明確に不合格と判定されました。論文では、研究の筋の良し悪しを見極める判断力の欠如、発想の非独創性、行き詰まった際の後戻りの下手さ、与えられた計算資源の使い残し、指示からの逸脱という5つの失敗パターンが繰り返し現れたと報告されています。
興味深いのは「エンジニアリングは人手を介さず完遂できた」という点です。コードを書き、実験を回し、論文の体裁に整えるところまで自動化は届いている一方、どの問いを立て、どの結果を捨てるかという判断が残っている。先に紹介した27Bエージェント「Faraday」が既存論文の再現で大規模モデルを上回ったことと合わせて読むと、「再現はできるが開拓はまだ」という現在地が鮮明になります。検証可能な短いタスクに偏りがちだった既存のベンチマークに対し、未発表論文とその原著者を評価装置として使うこの設計自体が、知識生成の自動化をどう測るかという問いへの一つの回答になっています。