メインコンテンツへ移動
モデルと技術

DeepSeek-V4-PRO AIモデルテスト:NVIDIA Vera Rubinの1メガワット当たりスループットはGB300の30倍

NVIDIAは、Vera Rubin NVL72システムのエージェントAIワークロードにおける1メガワット当たりスループットがGB300 NVL72比で最大30倍向上し、トークンコストが最大35分の1になると発表しました。そのアーキテクチャ設計と性能上の優位性を紹介します。Vera Rubinの消費電力当たりスループットはBlackwellの30倍に達します。

DeepSeek-V4-PRO AIモデルテスト:NVIDIA Vera Rubinの1メガワット当たりスループットはGB300の30倍

NVIDIAは昨日、SemiAnalysis AgentXワークロードを使用し、DeepSeek-v4-PRO 1.6Tモデルで評価テストを実施しました。その結果、Vera Rubinの1メガワット当たりスループットはBlackwellの30倍に達しました。

1メガワット当たりスループット(Tokens per Megawatt、略称 tokens / MW)は、AIデータセンターが限られた電力枠でどれだけのAIトークンを生成できるかを測る中核的な電力効率指標です。

DeepSeek-V4-PRO AIモデルテスト:NVIDIA Vera Rubinの1メガワット当たりスループットはGB300の30倍

IT之家がブログ記事を引用して紹介したところによると、SemiAnalysis AgentXは4つの指標を通じて、エージェント型コーディング推論ワークロードを重点的に評価します。

エンドツーエンドの正規化インタラクティビティは、リクエストの送信から最終トークンの到着までの全時間で算出し、最初のトークンを待つ時間を含む、ユーザーが目にする出力効率を反映します。

標準インタラクティビティは、最初のトークンから最後のトークンまでの生成段階のみを集計します。

エンドツーエンド遅延は、1回のリクエストの送信から最終出力トークンの到着までに要する総時間を集計します。

初回トークン遅延(TTFT)は、リクエストの送信から最初の出力トークンが到着するまでの時間を集計します。

DeepSeek-v4-PRO 1.6Tワークロードでは、GB300 NVL72を採用したGrace Blackwellサーバーの1メガワット当たりスループットは、H200 NVL8 Hopper構成の15倍に達しました。

DeepSeek-V4-PRO AIモデルテスト:NVIDIA Vera Rubinの1メガワット当たりスループットはGB300の30倍

Blackwellの100万トークン当たりコストは前世代の約10分の1です。運用者は同じ電力とインフラ予算でより多くのエージェントをサポートできるほか、より低い運用コストで同じエージェント容量を維持できます。

DeepSeek-V4-PRO AIモデルテスト:NVIDIA Vera Rubinの1メガワット当たりスループットはGB300の30倍

Vera Rubinはこの優位性をさらに高めます。DeepSeek V4 Proモデルにおいて、Vera Rubin NVL72の1メガワット当たりスループットはGB300 NVL72の約30倍です。

DeepSeek-V4-PRO AIモデルテスト:NVIDIA Vera Rubinの1メガワット当たりスループットはGB300の30倍

Vera Rubin NVL72の100万トークン当たりコストはGB300 NVL72の35分の1であり、エージェントを継続的かつ大規模に稼働させ、顧客のさまざまなワークロードのニーズに応えられます。

DeepSeek-V4-PRO AIモデルテスト:NVIDIA Vera Rubinの1メガワット当たりスループットはGB300の30倍
DeepSeek-V4-PRO AIモデルテスト:NVIDIA Vera Rubinの1メガワット当たりスループットはGB300の30倍