AI開発のペースを測る三つの指標 — Anthropicが自社の数字を添えて提案

Anthropicが2026年9月17日、フロンティア研究所におけるAI開発のペースを測るための指標を提案し、自社の実測値を添えて公開しました。「フロンティア研究所が知っていることと、世間が知っていることの差をできる限り小さくすべきだ」という趣旨です。指標は三つの柱からなります。第一は「AIがAI開発をどれだけ担っているか」で、AL0(AIの関与なし)からAL5(完全自律)までの自動化スケールで測ります。Anthropicの2026年8月時点の数字では、Claudeが同社のAI研究開発の26%を「主導(leads)」する水準にあり、90%以上が少なくとも「AIが協働する」水準に達している一方、測定したどの部分でもClaudeは完全自律では動いていないとしています。第二は「エージェントの監督」で、エージェントの行動のうち監視を通る割合(coverage)、行動から自動監視および人間によるレビューまでの時間(review latency)、遮断または要確認として上がった割合(escalation rate)の三つを測ります。同社の主要な社内基盤では約30,000体のエージェントが同時に稼働し、実行前後の監視はいずれもカバー率100%、遮断率は0.002%(約47,000件に1件)でした。第三は「計算資源の配分」で、AI研究開発の計算資源のうち安全性に向けた割合です。2026年7月時点でAI研究開発全体の6%、AIが主導する研究開発に限れば12%でした。Anthropicは他社に対し、共通の方法論での定期公開、監督指標の報告、計算資源配分の開示、そして第三者による検証の受け入れを求めています。

先日紹介したAmodeiのエッセイ「We Must Pace the Frontier」が「速度を落とすべきだ」という主張だったのに対し、今回は「では何をもって速度と呼ぶのか」に踏み込んだ提案です。注目したいのは、自動化スケールという定義を先に置いてから自社の数字を当てはめている点で、26%という値そのものより、その値が他社と比較可能になる枠組みを作ろうとしていることに重心があります。当部門で紹介したOpenAIの不整合開示枠組みが「何を観測し公開するか」の標準づくりだったのと同様、評価の単位を誰が定義するかという競争が始まっています。一方で「安全性研究とは何か」の線引きは各社の裁量に委ねられており、Anthropic自身も測定の前に業界共通の定義を確立する必要があると認めています。数字が出てきたこと自体は前進ですが、比較可能性の担保はこれからです。

https://www.anthropic.com/institute/measuring-pace-of-ai-development

上部へスクロール