
Runtaが2026年9月2日、コーディングエージェントの「ハーネス」(モデルを実際のタスクに接続する実行環境やツール群)を比較評価したFrontierHarness Evalを公開しました。9種のハーネスを12構成、計360試行のソフトウェア工学タスクで比較していますが、モデルはすべてKimi K3に固定し、vCPU・メモリ・ディスク内容・メモリ状態まで同一のゴールデンチェックポイントから毎回復元して実行しています。つまり変えているのはハーネスだけです。結果、タスクあたりの中央コストは最安のExo Harnessが1.05ドル(成功率53.3%)、最高のClaude Codeが18.34ドル(成功率63.3%)と約17倍の開きが出ました。成功率の首位はCodexの66.7%で、コストは3.47ドル。バランス型としてはPiが60.0%・2.43ドルという位置づけです。
この評価の要点は、品質とコストが連動しないという一点にあります。成功率の幅は50.0%から66.7%までの17ポイントに収まる一方、コストは17倍に開く。モデルを選ぶ議論は盛んですが、同じモデルでも実行環境の設計次第でこれだけ変わるのなら、選定の対象はモデルだけではないことになります。キャッシュヒット率が必ずしもコストに直結しない(キャッシュの効いた300ターンの失敗は、キャッシュミスの短い成功より高くつく)という指摘も実務的です。学内でコーディング支援ツールの導入を検討する際、ライセンス費用やモデルの評判ではなく、実際のタスク単価と成功率の組み合わせで測るべきだという示唆になります。ただし評価はRunta社自身のランタイム上で行われており、対象はソフトウェア工学とターミナル作業に限られる旨が明記されています。同社は自社プラットフォームの提供者でもあるため、その立場は踏まえて読む必要があるでしょう。評価コードはGitHubで公開されています。