IOI 2026で人間の首位を上回る — Nemotron-3-Ultra-CCの535.4点と、30Bが金メダル圏に届いた話

NVIDIAの研究チームが2026年9月2日、競技プログラミングに特化した事後学習の論文をarXivに投稿しました(arXiv:2609.02849)。22,000問を精選した問題集合をもとに、合成推論トレース、教師ありファインチューニング(SFT)、強化学習(RL)を組み合わせる一貫したパイプラインを構築し、Nemotron-3-Nano-CC(30B-A3B)をSFTとRLで、Nemotron-3-Ultra-CC(550B-A55B)をSFTのみで学習させています。さらにGenCorrectという、多様な解を生成・評価・改良し続けるテスト時計算の戦略を提案しました。IOI 2025では、Nano-CCが事後学習前の130点から291点へ、GenCorrectを併用すると468点に達し、金メダル閾値438.3を超えています。Ultra-CCは502点。そしてIOI 2026では、人間の参加者と同じ制限時間・インターネット接続・提出回数の条件下で前向きに評価し、600点満点中535.4点を記録しました。金メダル閾値361.12はもちろん、人間の最高得点498.27をも上回っており、著者らは「AIシステムがIOIの問題セットで人間の最高得点者を上回った初の事例」としています。

報道では550Bのモデルが人間を抜いたという点が目を引きますが、部門の関心から見て重要なのは30BのNano-CCでしょう。事後学習だけで130点から291点へ、テスト時の工夫を加えて468点へと、金メダル圏に届いています。事前学習の規模ではなく、精選した問題集合と事後学習、そして推論時の探索戦略で押し上げた形です。8月19日に紹介したGLM-5.3が事前学習を変えずに事後学習の拡張だけで性能を伸ばした事例、9月2日に紹介したARC-AGIの小規模Transformerと合わせると、「どこに計算を投じるか」の設計が成果を左右するという同じ論点が、規模を問わず繰り返し現れていることが分かります。競技という設定は問題が明確に定義され自動採点できるため、研究上の課題とは条件が異なりますが、GenCorrectのような検証を伴う反復戦略は、検証可能性のある領域なら応用が利くはずです。なお本論文は査読前のプレプリントで、IOI 2026での評価も著者らによる実施です。

https://arxiv.org/abs/2609.02849

上部へスクロール