Personal news Publisher

NVIDIA AVOがARC-AGI-3満点、AI競争はモデル単体から実行基盤へ

NVIDIAは8月21日、長時間動くAIエージェント基盤AVOで、Claude Opus 5を使いARC-AGI-3公開セットの25環境183レベルを完了し、100.00 RHAEを記録したと発表しました。背景には、モデルの賢さだけでは長い作業を安定して進めにくく、記憶、道具、監督、失敗からの復帰が性能を左右する現実があります。今後は、どのモデルを選ぶかだけでなく、その周囲の実行基盤をどう設計し、安全に運用するかが企業AIの焦点になります。

NVIDIA AVOがモデルの周囲で記憶、道具、監督、検証を担う流れの図解

AVOが公開セットを完了

AVOは、コードの調査、変更、実行、検証を繰り返すための汎用エージェント基盤です。NVIDIAは同じ仕組みをGPUカーネル最適化からARC-AGI-3へ転用し、公開セットで全183レベルを6,624アクションで完了したと説明しました。比較対象のVISTAは同じ183レベルで7,542アクションとされています。

モデルではなく基盤設計が差を生む

重要なのは、NVIDIAが新しい基盤モデルを出したのではなく、同じモデルを取り巻くハーネスで結果が変わった点です。AVOは過去の試行、評価結果、道具の出力を記憶し、進捗が止まった時には監督役が別の方針へ戻します。NVIDIA自身も、公開セットの結果であり、非公開競技セットの成績ではないと注記しています。

運用では権限と監査も同時に見る

企業がAIエージェントを導入する時、モデル比較だけで判断すると、実運用で必要な長期記憶、検証ループ、権限管理を見落とします。業務の自動化では、何を覚え、どの道具を使わせ、失敗時にどう止めるかが成果とリスクの両方を決めます。 ベンチマークの満点は、顧客対応や経理処理など全業務で同じ効果を保証しません。実装時は、ハーネスの誘導だけでなく、実行環境側の最小権限、監査ログ、承認を別に設計する必要があります。

引用元