Personal news Publisher

NVIDIA Vera Rubin、エージェントAIの電力効率を30倍に

NVIDIAは8月24日、Vera Rubin NVL72がエージェントAI推論でGB300 NVL72比最大30倍のスループット毎メガワット、35倍低いトークンコストを示したと発表しました。背景には、AIエージェントが検索、道具利用、サブエージェント呼び出しを重ね、通常のチャットより長い文脈と多くのトークンを消費する変化があります。今後は、モデル性能だけでなく、電力あたり処理量、長文脈の保持、推論遅延を抑える基盤設計が、AIサービスの採算と体験を左右します。

NVIDIA Vera Rubinが長文脈処理と生成高速化でエージェントAIの効率を高める流れの図解

Vera Rubinで推論効率を提示

NVIDIAは、実際のエージェント型コーディング作業を再現するSemiAnalysis AgentXワークロードで測定した初期データを示しました。Vera Rubin NVL72はDeepSeek V4 ProモデルでGB300 NVL72比最大30倍のスループット毎メガワットを記録し、トークン100万件あたりのコストも最大35倍低いと説明されています。

長文脈と生成を分けて速める

同日、NVIDIAはGroq 3 LPXが本格生産に入ったことも発表しました。Gemma 4 31Bの10万トークン長文脈ベンチマークでは、毎秒約3,400出力トークンを出したとされ、Nebius、CoreWeave、SpaceXAIなどの採用計画も示されました。長い文脈をGPUで処理し、遅延が目立つ生成部分をLPXで速める設計が中心です。

採算は電力と遅延で決まる

企業がエージェントAIを本番投入するほど、GPUを増やすだけでは電力、冷却、応答速度が制約になります。電力あたりの処理量が改善すれば、同じデータセンター枠でより多くのエージェントを動かしやすくなり、クラウド事業者やAIサービスの料金設計にも影響します。 ただし、数値はNVIDIAが示した初期測定を含み、一部は外部レビュー待ちです。利用企業は、自社のモデル、文脈長、道具呼び出し、同時実行数で同じ効率が出るかを別に検証する必要があります。

引用元