27Bのエージェントが論文の再現で大規模モデルを上回る — Inherentの「Faraday」

ロンドンのAIラボInherentが2026年8月22日、研究エージェント「Faraday」を公開しました。同社はGoogle DeepMind出身者らが設立し、Index Venturesが主導する5,000万ドルのシードラウンドでステルスを抜けたばかりです。Faradayの中核は270億パラメータのQwen 3.6で、コーディングは自前のツールではなくOpenAIのGPT-5.5 Codexに委ねる構成をとります。同社独自のベンチマークReplica(機械学習およびAI for scienceの論文100本から作った310タスク)において、答えを事前に与えられない条件で公開論文の結果を再現させたところ、Claude Opus 4.8とGPT-5.5を上回ったとしています。分布内のタスクではClaudeに対し73%で勝利し、未見のAI for science論文でも優位を保ったとのことです。

興味深いのは、強化学習で鍛えたのがタスクの遂行能力ではなく、どの実験に労力を割くかという判断——同社が「research taste」と呼ぶもの——だという点です。共同創業者のEdward Hughes氏は、論文の再現が人間の博士課程学生にとっても標準的な訓練であることを引き合いに出しています。昨日紹介したClaudeによるタンパク質設計が既存の公開モデル群を指揮して成果を出したのと同様、ここでも「新しい基盤モデルを作る」のではなく「既存の道具をどう選び組み合わせるか」が性能を左右しており、知識生成の研究にとって示唆的です。27Bという規模で大規模モデルを上回ったという主張も、当部門が繰り返し取り上げてきた小規模モデルの実用性という論点に重なります。ただし数値スコア、対象論文、評価手法はいずれも未公開で、第三者による検証もありません。Faradayが実際に新しい科学的知見を生み出せるかは、これからの証明課題です。

https://techcrunch.com/2026/08/22/inherent-founded-by-deepmind-alumni-says-its-ai-teammate-just-outperformed-anthropic-and-openai-at-replicating-research/

上部へスクロール