엔비디아 베라루빈(Vera Rubin)은 단일 GPU 이름이 아니라 Rubin GPU, Vera CPU, NVLink 6와 네트워킹·스토리지 구성요소를 함께 설계한 데이터센터 AI 플랫폼입니다. 핵심 연산 칩인 Rubin GPU는 현재 NVIDIA 공식 사양에서 최대 288GB HBM4, 최대 22TB/s 메모리 대역폭, NVFP4 추론 최대 50PFLOPS, NVFP4 학습 최대 35PFLOPS를 제시합니다. Vera Rubin NVL72는 Rubin GPU 72개와 Vera CPU 36개를 한 랙 스케일 시스템으로 묶습니다.
2026년 8월 9일 기준 출시 상태도 기존의 단순한 ‘하반기 출시 예정’ 단계에서 더 진행됐습니다. NVIDIA는 7월 21일 Vera Rubin NVL72 생산이 램프업 중이며 CoreWeave, Google Cloud, Microsoft Azure, Oracle Cloud Infrastructure, Nebius 등 파트너에서 랙이 가동 중이라고 밝혔고, 현재 Vera Rubin 공식 페이지는 시스템이 생산·출하되고 있다고 안내합니다. 다만 일반 고객의 실제 구매·클라우드 사용 가능 시점은 제조사와 서비스 사업자별로 다를 수 있습니다.
이름을 구분하면 사양표를 잘못 읽을 가능성이 줄어듭니다
- Rubin GPU: AI 학습·추론 연산을 담당하는 GPU입니다.
- Vera CPU: 데이터 이동, 오케스트레이션, 에이전틱 워크로드의 CPU 측 처리를 맡는 NVIDIA CPU입니다.
- Vera Rubin Superchip: Vera CPU 1개와 Rubin GPU 2개를 결합한 구성입니다.
- Vera Rubin NVL72: Rubin GPU 72개와 Vera CPU 36개를 NVLink 6로 연결한 랙 스케일 시스템입니다.
- Vera Rubin 플랫폼: NVL72, Vera CPU 랙, Groq 3 LPX, Vera BlueField-4 STX, Spectrum-6 SPX Ethernet 등 여러 랙 스케일 시스템을 함께 구성하는 AI 인프라입니다.
엔비디아 베라루빈의 Rubin GPU 핵심 스펙: 288GB HBM4와 최대 50PFLOPS NVFP4
Rubin GPU는 두 개의 컴퓨트 다이를 NV-HBI(NVIDIA High-Bandwidth Interface)로 연결한 단일 패키지 구조입니다. NVIDIA의 2026년 7월 21일 아키텍처 공개 자료에 따르면 3,360억 개의 트랜지스터, 224개 스트리밍 멀티프로세서(SM), 896개 Tensor Core를 갖추며 3세대 Transformer Engine을 사용합니다.
GPU당 메모리는 최대 288GB HBM4, 메모리 대역폭은 최대 22TB/s입니다. NVLink 6는 GPU당 3.6TB/s의 스케일업 대역폭을 제공하고, Vera CPU와 Rubin GPU 사이의 NVLink-C2C는 최대 1.8TB/s의 코히어런트 대역폭을 제공합니다. NVIDIA는 Rubin GPU의 NVFP4 성능을 추론 최대 50PFLOPS, 학습 최대 35PFLOPS로 공개하고 있습니다.
이 값들은 모두 같은 종류의 실사용 벤치마크가 아니라 피크 연산 성능과 메모리·인터커넥트 사양입니다. 세부 구조는 NVIDIA Rubin GPU 아키텍처 공식 기술 블로그에서 확인할 수 있습니다. NVIDIA의 Vera Rubin 제품 사양에는 예비 정보이며 최대값이 변경될 수 있다는 주석이 있으므로 실제 출하 제품의 최종 사양은 도입 시점에 다시 확인해야 합니다.
Blackwell 대비 Rubin GPU 변화는 연산·메모리·NVLink에서 확인됩니다
NVIDIA가 2026년 공식 기술 자료에서 제시한 Blackwell 대비 Rubin의 세대 비교는 아래와 같습니다. 이 표는 NVIDIA가 해당 자료에서 ‘Blackwell’로 표기한 비교 기준을 그대로 따른 것이며, Blackwell Ultra 또는 특정 GB300 SKU와의 직접 비교표가 아닙니다.
| 비교 항목 | Blackwell | Rubin |
|---|---|---|
| 트랜지스터 | 2,080억 개 | 3,360억 개 |
| NVFP4 추론 | 10PFLOPS | 최대 50PFLOPS |
| NVFP4 학습 | 10PFLOPS | 최대 35PFLOPS |
| HBM 메모리 대역폭 | 8TB/s | 최대 22TB/s |
| NVLink 대역폭 | 1.8TB/s | 3.6TB/s |
NVIDIA가 정리한 세대 차이는 NVFP4 추론 최대 5배, 학습 3.5배, HBM 대역폭 약 2.8배, NVLink 대역폭 2배입니다. 그러나 이 배수는 동일 항목의 하드웨어 사양 비교이지 모든 AI 모델의 실제 처리속도가 같은 비율로 증가한다는 뜻은 아닙니다.
특히 ‘10배’라는 표현은 범위를 확인해야 합니다. NVIDIA는 Vera Rubin NVL72가 GB200 NVL72 대비 특정 Kimi-K2-Thinking 워크로드에서 메가와트당 최대 10배 높은 추론 처리량을 제공한다고 제시하고 있으며, 별도의 내부 2조 파라미터 MoE 에이전틱 워크로드에서도 세대 간 최대 10배 향상을 제시합니다. 따라서 단일 Rubin GPU가 모든 환경에서 Blackwell GPU보다 10배 빠르다고 바꾸어 말하면 정확하지 않습니다.
Vera CPU와 NVL72는 GPU 밖의 데이터 이동·통신 병목을 줄이는 구조입니다
Vera CPU는 88개의 NVIDIA Olympus 코어와 176개 스레드를 제공하며 최대 1.5TB LPDDR5X 메모리, 최대 1.2TB/s 메모리 대역폭을 지원합니다. Rubin GPU와 연결할 때 NVLink-C2C는 최대 1.8TB/s의 코히어런트 대역폭을 제공합니다. NVIDIA는 Vera를 단순 호스트 CPU보다 데이터 이동, 오케스트레이션, 샌드박스 실행, 강화학습과 에이전틱 워크로드에 필요한 CPU 측 처리를 확장하는 역할로 설명합니다.
Vera Rubin NVL72는 Rubin GPU 72개와 Vera CPU 36개를 통합합니다. 현재 공식 사양은 GPU 메모리 합계 20.7TB HBM4, GPU 메모리 대역폭 최대 1,580TB/s, NVLink 6 스위치 대역폭 260TB/s, NVFP4 추론 3,600PFLOPS를 제시합니다. 단일 GPU의 50PFLOPS와 NVL72 전체의 3,600PFLOPS는 범위가 다른 수치이므로 ‘Rubin 성능’이라는 표현만 보고 서로 비교하면 안 됩니다.
NVL72의 현재 공식 구성과 예비 사양은 NVIDIA Vera Rubin NVL72 제품 페이지에서 직접 확인할 수 있습니다.
2026년 베라루빈 양산·출하 현황은 공식 발표 시점에 따라 구분해야 합니다
Vera Rubin의 상태는 2026년 들어 빠르게 바뀌었기 때문에 오래된 한 문장만 인용하면 현재 상황을 잘못 전달할 수 있습니다. 공식 발표를 시간순으로 보면 칩 생산, 플랫폼 생산 램프업, 파트너 랙 가동이 단계적으로 확인됩니다.
| 공식 발표일 | NVIDIA가 밝힌 상태 | 현재 읽는 방법 |
|---|---|---|
| 2026년 3월 16일 | 7개 신규 칩이 full production | 핵심 칩 생산 단계 진입 |
| 2026년 5월 31일 | 플랫폼이 full production으로 램프업, 당시 production shipments는 가을 시작 예정 | 5월 시점의 생산·출하 계획 |
| 2026년 7월 21일 | NVL72 생산 램프업, 주요 클라우드 파트너에서 랙 가동 | 5월 발표보다 최신인 실제 배치 진행 상황 |
따라서 2026년 8월 9일 현재는 ‘아직 하반기 출시를 기다리는 제품’이라고만 설명하는 것보다 양산 램프업이 진행 중이고 일부 주요 파트너에서 랙이 가동되며, 현재 NVIDIA 제품 페이지는 Vera Rubin 기반 시스템이 출하되고 있다고 안내하는 단계라고 쓰는 편이 정확합니다. 다만 이 표현은 모든 OEM 제품이나 모든 클라우드 리전에서 일반 구매·사용이 이미 가능하다는 뜻은 아닙니다.
7월 21일의 후속 생산·배치 상황은 NVIDIA 공식 블로그의 Vera Rubin 생산 업데이트에서 확인할 수 있습니다.
베라루빈 성능 수치는 비교 단위와 조건을 먼저 확인해야 합니다
Rubin의 숫자를 실제 도입 판단에 쓰려면 피크 PFLOPS 하나보다 어떤 범위의 수치인지 먼저 확인해야 합니다. 같은 ‘성능’이라도 단일 GPU, Superchip, NVL72 랙, 여러 랙을 묶은 POD는 계산 범위가 다르고, 추론 성능도 모델·정밀도·컨텍스트 길이·전력 조건에 따라 결과가 달라집니다.
Rubin 성능표를 볼 때 확인할 세 가지
- 범위: 단일 Rubin GPU인지, Vera Rubin Superchip인지, NVL72 전체인지 확인합니다.
- 비교 대상: Blackwell, Blackwell Ultra, GB200 NVL72 가운데 무엇과 비교했는지 확인합니다.
- 측정 조건: 피크 이론 성능인지, NVIDIA 내부 워크로드인지, 실제 애플리케이션 벤치마크인지 구분합니다.
이 세 조건을 맞추면 ‘5배’, ‘10배’ 같은 수치를 서로 다른 기준에서 섞는 오류를 줄일 수 있습니다. 실제 구매나 클라우드 선택에서는 같은 모델과 같은 서비스 수준에서 토큰 처리량, 지연시간, 전력, 비용을 함께 비교하는 것이 필요합니다.
Vera Rubin 최신 공식 사양과 제품군 확인
NVIDIA 공식 페이지에서 Vera Rubin 플랫폼 구성, NVL72와 Rubin 제품군의 현재 안내를 확인할 수 있습니다.
NVIDIA에서 Vera Rubin 최신 정보 확인자주 묻는 질문
Q1. 베라루빈은 GPU 이름인가요?
A1. 정확히는 Vera Rubin은 플랫폼 이름이고 GPU 이름은 Rubin GPU입니다. Vera Rubin에는 Rubin GPU뿐 아니라 Vera CPU, NVLink 6, 네트워킹·스토리지 구성요소와 여러 랙 스케일 시스템이 포함됩니다.
Q2. 베라루빈은 지금 출하 중인가요?
A2. NVIDIA의 2026년 7월 21일 공식 업데이트는 NVL72 생산이 램프업 중이고 주요 파트너에서 랙이 가동 중이라고 밝히며, 현재 공식 제품 페이지는 Vera Rubin 기반 시스템이 생산·출하되고 있다고 안내합니다. 다만 제조사별 완제품 판매와 클라우드 서비스 제공 시점은 서로 다를 수 있으므로 실제 이용 가능 여부는 해당 사업자의 최신 안내를 확인해야 합니다.
Q3. 5월 발표에는 가을 출하라고 했는데 왜 현재 설명이 다른가요?
A3. 2026년 5월 31일 보도자료의 ‘가을부터 production shipments 시작 예정’은 당시의 미래 일정 안내였습니다. 이후 7월 21일 NVIDIA가 생산 램프업과 파트너 랙 가동을 공개했고 현재 제품 페이지도 출하 진행을 안내하므로, 현재 상태 판단에는 더 최신 공식 자료를 우선하는 것이 맞습니다.
Q4. 베라루빈이 Blackwell보다 무조건 10배 빠른가요?
A4. 아닙니다. NVIDIA의 최대 10배 수치는 특정 모델·시스템·전력 조건에서 측정하거나 전망한 랙 스케일 지표입니다. 단일 Rubin GPU의 모든 애플리케이션 성능이 Blackwell GPU보다 일괄적으로 10배라는 의미는 아니므로 비교 대상과 워크로드 조건을 함께 확인해야 합니다.
Q5. Vera Rubin NVL72 가격은 얼마인가요?
A5. 2026년 8월 9일 현재 이 글에서 확인한 NVIDIA 공식 Vera Rubin 제품 페이지에는 NVL72의 공개 정가가 제시되어 있지 않습니다. 실제 도입 비용은 시스템 구성과 공급 파트너에 따라 달라질 수 있으므로 NVIDIA 또는 해당 OEM·클라우드 사업자의 견적과 가격 안내를 확인해야 합니다.



Comments