엔비디아 블랙웰과 베라루빈(Vera Rubin)의 성능 차이는 하나의 배율로 설명할 수 없습니다. NVIDIA의 GPU 세대 비교에서 Blackwell의 NVFP4 추론은 10 PFLOPS, Rubin은 50 PFLOPS로 최대 5배지만, NVFP4 학습은 3.5배, HBM 대역폭은 약 2.8배, GPU 간 NVLink 대역폭은 2배입니다. 따라서 “5배”는 NVIDIA가 제시한 NVFP4 피크 추론 지표의 세대 차이로 읽는 것이 정확합니다.
비교할 때는 GPU 한 개의 피크 사양과 NVL72 랙 전체의 실측·예상 처리량을 섞지 않는 것이 중요합니다. Blackwell Ultra도 기본 Blackwell과 다른 제품군이므로 기본 Blackwell의 10 PFLOPS를 기준으로 한 5배 수치를 GB300/B300에 그대로 적용하면 안 됩니다.
비교 기준을 먼저 나누기
- GPU 세대 비교: Blackwell GPU와 Rubin GPU의 NVFP4, HBM, NVLink 같은 피크 사양을 비교합니다.
- 랙 시스템 비교: GB200 NVL72와 Vera Rubin NVL72처럼 같은 모델·입출력 길이·전력 조건의 처리량을 비교합니다.
- Blackwell Ultra 비교: GB300 NVL72 또는 B300 GPU 기반 구성은 기본 Blackwell과 별도로 동일 조건 벤치마크를 확인합니다.
엔비디아 블랙웰 vs 베라루빈 5배 차이는 어디서 나오나
NVIDIA가 공개한 Blackwell 대 Rubin GPU 비교표를 같은 항목끼리 계산하면 지표별 배율이 분명해집니다. NVFP4 추론은 10에서 50 PFLOPS로 5배지만 다른 항목은 서로 다른 폭으로 개선됩니다.
| 비교 지표 | Blackwell GPU | Rubin GPU |
|---|---|---|
| NVFP4 추론 | 10 PFLOPS | 50 PFLOPS, 5배 |
| NVFP4 학습 | 10 PFLOPS | 35 PFLOPS, 3.5배 |
| HBM 대역폭 | 8 TB/s | 22 TB/s, 약 2.8배 |
| GPU 간 NVLink | 1.8 TB/s | 3.6 TB/s, 2배 |
| FP64 벡터 | 40 TFLOPS | 33 TFLOPS |
| FP64 행렬 | 150 TFLOPS | 200 TFLOPS |
FP64도 벡터와 행렬 수치가 서로 다릅니다. NVIDIA는 FP64 행렬 수치를 Tensor Core 기반 에뮬레이션 알고리즘을 사용한 피크 성능으로 설명하고 있으므로, 과학·공학 계산은 단일 FP64 숫자보다 실제 애플리케이션 벤치마크를 함께 봐야 합니다.
메모리 용량 역시 제품명까지 맞춰 비교해야 합니다. NVIDIA의 아키텍처 자료에는 기본 Blackwell의 최대 HBM 용량이 192 GB로 제시되지만 실제 B200·GB200 등 SKU의 공개 용량은 구성에 따라 다릅니다. 이 때문에 이 글의 핵심 비교표에서는 용량 숫자 대신 같은 세대 비교에서 직접 확인되는 HBM 대역폭을 사용했습니다.
실사용 성능은 워크로드와 비교 레벨을 맞춰 확인한다
실제 AI 처리량은 피크 PFLOPS만으로 결정되지 않습니다. 긴 컨텍스트 추론은 메모리 이동과 KV 캐시의 영향을 받고, MoE 모델은 GPU 간 토큰 라우팅과 통신이 병목이 될 수 있습니다. 전력 제한 데이터센터에서는 GPU 한 장의 PFLOPS보다 랙 전체의 tokens/s/MW가 더 직접적인 운영 지표가 될 수 있습니다.
| 비교 상황 | 우선 볼 지표 | 확인된 차이와 조건 |
|---|---|---|
| 저정밀 AI 추론 피크 | NVFP4 PFLOPS | Blackwell 10 → Rubin 50 PFLOPS |
| 긴 컨텍스트·메모리 병목 | HBM 대역폭·용량 | 대역폭 8 → 22 TB/s, 용량은 정확한 SKU 확인 |
| MoE 다중 GPU 통신 | NVLink·all-to-all 처리량 | GPU당 NVLink 1.8 → 3.6 TB/s |
| 전력 제한 AI 팩토리 | tokens/s/MW | CoreWeave DeepSeek-R1 측정에서 Grace Blackwell NVL72 대비 10배 |
| Kimi-K2-Thinking 추론 | tokens/s/MW·토큰 비용 | 32K 입력·8K 출력에서 최대 10배 처리량/MW, 100만 토큰당 비용 10분의 1 |
2026년 7월 21일 NVIDIA가 공개한 CoreWeave의 라이브 하드웨어 측정에서는 DeepSeek-R1을 Vera Rubin NVL72에서 실행했을 때 Grace Blackwell NVL72보다 메가와트당 토큰 처리량이 10배 높았습니다. 다만 이는 NVIDIA가 전한 파트너 측정 결과이며 모든 모델·배치·지연 조건에서 10배를 보장하는 독립 범용 벤치마크는 아닙니다.
NVIDIA Vera Rubin NVL72 제품 페이지의 Kimi-K2-Thinking 비교도 GB200 NVL72 대비 메가와트당 최대 10배 토큰 처리량과 100만 토큰당 비용 10분의 1을 제시합니다. 해당 페이지는 32K 입력·8K 출력 조건을 명시하고 성능 수치가 변경될 수 있다고 밝히므로, 실제 클라우드 요금이나 다른 LLM에 같은 배율을 그대로 적용해서는 안 됩니다.
블랙웰과 베라루빈은 내 워크로드의 병목으로 비교한다
실제 선택에서는 세대 이름보다 현재 워크로드의 병목을 먼저 정하면 됩니다. 같은 모델과 정밀도, 입력·출력 길이, 배치 크기, 지연 목표를 맞춘 뒤 아래 순서로 비교하면 피크 사양과 실사용 결과를 혼동하기 어렵습니다.
- 연산이 병목: NVFP4 피크와 실제 tokens/s를 함께 확인합니다.
- 긴 컨텍스트가 병목: HBM 용량·대역폭과 KV 캐시 적재 조건을 확인합니다.
- MoE 통신이 병목: NVLink 대역폭과 실제 all-to-all 처리량을 확인합니다.
- 전력이 병목: 동일 모델의 tokens/s/MW를 비교합니다.
- Blackwell Ultra가 비교 대상: 기본 Blackwell의 5배 수치를 재사용하지 말고 GB300 NVL72 또는 B300 기반 시스템과 Vera Rubin의 동일 조건 자료를 비교합니다.
결론적으로 저정밀 추론의 피크 연산량을 보는 목적이라면 Rubin의 50 PFLOPS가 핵심이고, 실제 서비스 도입 판단이라면 같은 워크로드에서 처리량·지연·메모리·전력 지표를 함께 확인해야 합니다.
NVIDIA 공식 자료에서 비교 조건을 확인하는 위치
아래 자료는 각각 역할이 다릅니다. GPU 세대 피크 사양, Blackwell Ultra의 별도 기준, Vera Rubin NVL72의 제품 사양·벤치마크 조건, 파트너 라이브 하드웨어 측정을 구분해서 확인할 수 있습니다.
- NVIDIA 기술 블로그에서 Blackwell과 Rubin GPU 세대 지표 확인
- NVIDIA 기술 블로그에서 기본 Blackwell과 Blackwell Ultra 차이 확인
- NVIDIA Vera Rubin NVL72 공식 사양과 Kimi-K2-Thinking 비교 조건 확인
- NVIDIA의 CoreWeave 라이브 측정과 2026년 7월 파트너 배포 현황 확인
자주 묻는 질문
Q1. 베라루빈은 블랙웰보다 무조건 5배 빠른가요?
A1. 아닙니다. NVIDIA가 제시한 5배는 기본 Blackwell GPU와 Rubin GPU의 NVFP4 추론 피크 지표를 비교한 값입니다. 실제 서비스 속도는 모델, 정밀도, 메모리, 통신, 배치와 지연 목표에 따라 달라집니다.
Q2. Blackwell Ultra와 비교해도 5배 차이인가요?
A2. 그대로 적용할 수 없습니다. NVIDIA 자료에서 기본 Blackwell은 NVFP4 10 PFLOPS, Blackwell Ultra는 dense NVFP4 15 PFLOPS로 구분됩니다. Rubin의 5배 세대 표시는 기본 Blackwell과의 비교이므로 Ultra와는 동일한 성능 정의와 시스템 조건으로 다시 비교해야 합니다.
Q3. Vera Rubin의 토큰 비용 10분의 1은 실제 클라우드 가격인가요?
A3. 아닙니다. NVIDIA 제품 페이지가 제시한 특정 Kimi-K2-Thinking 워크로드의 시스템 비교 지표입니다. 실제 클라우드 이용요금은 사업자, 지역, 인스턴스와 계약 조건에 따라 달라집니다.
Q4. 2026년 8월 현재 Vera Rubin은 실제로 가동 중인가요?
A4. 일부 파트너 환경에서는 가동 중입니다. NVIDIA는 2026년 7월 21일 CoreWeave, Google Cloud, Microsoft Azure, Oracle Cloud Infrastructure, Nebius에서 Vera Rubin NVL72 랙이 운영 중이라고 밝혔습니다. 다만 고객별 실제 주문·인스턴스 이용 가능 여부는 공급사와 지역별로 별도 확인해야 합니다.


Comments