주요 콘텐츠로 건너뛰기
모델 및 기술

DeepSeek-V4-PRO AI 모델 테스트: 엔비디아 Vera Rubin, 와트당 처리량에서 GB300의 30배 달성

엔비디아가 공개한 Vera Rubin NVL72 시스템은 에이전트 AI 워크로드에서 GB300 NVL72보다 메가와트당 처리량을 최대 30배 높이고 토큰 비용을 최대 35배 낮춘다. Vera Rubin의 아키텍처 설계와 성능 우위를 소개하며, 단위 전력당 처리량은 Blackwell의 30배에 달한다

DeepSeek-V4-PRO AI 모델 테스트: 엔비디아 Vera Rubin, 와트당 처리량에서 GB300의 30배 달성

엔비디아는 어제 SemiAnalysis AgentX 워크로드와 DeepSeek-v4-PRO 1.6T 모델을 사용해 평가 테스트를 진행했으며, Vera Rubin의 메가와트당 처리량이 Blackwell의 30배에 달하는 것으로 나타났다.

메가와트당 처리량(Tokens per Megawatt, 약칭 tokens / MW)은 AI 데이터센터가 정해진 전력 한도에서 얼마나 많은 AI 토큰을 생성할 수 있는지를 측정하는 핵심 전력 효율 지표다.

DeepSeek-V4-PRO AI 모델 테스트: 엔비디아 Vera Rubin, GB300의 30배 처리량

IT之家가 블로그 게시물을 인용해 소개한 내용에 따르면, SemiAnalysis AgentX는 4개 지표를 통해 에이전트 프로그래밍 추론 워크로드를 중점적으로 평가했다.

엔드투엔드 정규화 상호작용성은 요청 제출부터 최종 토큰 도착까지의 전체 시간을 기준으로 계산하며, 첫 번째 토큰 대기 시간을 포함한 사용자가 체감하는 출력 효율을 반영한다.

표준 상호작용성은 첫 번째 토큰부터 마지막 토큰까지의 생성 단계만 집계한다.

엔드투엔드 지연 시간은 단일 요청의 제출부터 최종 출력 토큰 도착까지 걸린 총 시간을 집계한다.

첫 번째 토큰 지연 시간(TTFT)은 요청 제출부터 첫 번째 출력 토큰 도착까지의 시간을 집계한다.

DeepSeek-v4-PRO 1.6T 워크로드에서 GB300 NVL72를 사용하는 Grace Blackwell 서버의 메가와트당 처리량은 H200 NVL8 Hopper 솔루션의 15배에 달했다.

DeepSeek-V4-PRO AI 모델 테스트: 엔비디아 Vera Rubin, GB300의 30배 처리량

Blackwell의 토큰 100만 개당 비용은 이전 세대의 약 10분의 1이다. 운영자는 동일한 전력과 인프라 예산으로 더 많은 에이전트를 지원하거나, 더 낮은 운영 비용으로 동일한 에이전트 용량을 유지할 수 있다.

DeepSeek-V4-PRO AI 모델 테스트: 엔비디아 Vera Rubin, GB300의 30배 처리량

Vera Rubin은 이러한 우위를 한층 더 높인다. DeepSeek V4 Pro 모델에서 Vera Rubin NVL72의 메가와트당 처리량은 GB300 NVL72의 약 30배다.

DeepSeek-V4-PRO AI 모델 테스트: 엔비디아 Vera Rubin, GB300의 30배 처리량

Vera Rubin NVL72의 토큰 100만 개당 비용은 GB300 NVL72의 35분의 1이다. 이를 통해 에이전트를 지속적이고 대규모로 실행하며 고객의 다양한 워크로드 요구를 충족할 수 있다.

DeepSeek-V4-PRO AI 모델 테스트: 엔비디아 Vera Rubin, GB300의 30배 처리량
DeepSeek-V4-PRO AI 모델 테스트: 엔비디아 Vera Rubin, GB300의 30배 처리량