Thomson Reuters が自社データで独自LLM「Thomson」を構築 — 4,000万ドル、最終学習は45万ドル

Thomson Reutersが2026年8月24日、自社初の独自大規模言語モデル「Thomson」を発表しました。ゼロから基盤モデルを作るのではなく、オープンウェイトのモデルを出発点に、Westlaw、Practical Law、Checkpoint、Reutersに蓄積された数十年分のコンテンツで中間学習・事後学習を施す方式です。数百名の専門家が学習目標の設計から最終評価まで関与したとされ、投じた費用は人材と計算資源を合わせ2年間で約4,000万ドル。ただし最終的な学習実行そのものは約45万ドルまで下がったといいます。学習に使ったのは同社コンテンツの1割未満で、最初の適用先はCoCounsel Legalの表形式分析機能です。学術・非商用向けには小規模なオープンウェイト版がHugging Faceで公開されます。

同社幹部の「Thomsonは汎用知能のフロンティアに追いつく必要はない。法務における知能のフロンティアを定めればよい」という言葉が、この試みの性格をよく表しています。汎用モデルとの競争ではなく、他者が持たないデータと編集上の専門性を差別化の源泉に置く戦略です。当部門の関心に引きつけるなら、これは「知識資産をどうモデル化するか」という問題であり、大学や研究機関が抱える固有のコーパス——紀要、実験ノート、事務規程など——にも同じ問いが当てはまります。最終学習が45万ドルという数字は、オープンウェイトを土台にすれば専門特化モデルの構築が現実的な予算に収まりうることを示しており、一昨日のFaradayと同様、規模ではなく設計で勝負する事例と言えます。なお、フロンティアモデルと同等という評価は現時点では同社の内部評価に基づくものです。

https://www.thomsonreuters.com/en/press-releases/2026/august/thomson-reuters-leverages-its-world-class-data-assets-to-launch-its-own-frontier-model

上部へスクロール