NVIDIA Rubin은 Vera Rubin 플랫폼의 중심 GPU 아키텍처로, 장문 추론·도구 사용·검증을 반복하는 에이전틱 AI 워크로드를 겨냥한다. NVIDIA는 Rubin이 Blackwell 대비 단위 에너지당 에이전틱 처리량을 최대 10배 높인다고 설명한다.
핵심 스펙
| 항목 | 내용 |
|---|---|
| 트랜지스터 | 3360억 개 |
| SM / Tensor Core | 224 SM, 896 Tensor Core |
| 저정밀 연산 | 3세대 Transformer Engine, 최대 50 PFLOPS NVFP4 inference |
| 메모리 | GPU당 최대 288GB HBM4, 최대 22TB/s 대역폭 |
| GPU 간 통신 | NVLink 6, NVLink Switch 연결 기준 3,600GB/s scale-up bandwidth |
| 랙 시스템 | Vera Rubin NVL72, 액체 냉각, 전력 smoothing, hot-swappable NVLink switch tray |
왜 에이전틱 AI용인가
에이전틱 워크로드는 한 번의 prompt-response보다 길다. 모델이 계획을 세우고, 도구를 호출하고, 중간 결과를 검증하고, 긴 컨텍스트를 유지하며 여러 단계의 추론을 반복한다. 이때 병목은 단순 GEMM 성능만이 아니다.
- MoE 모델의 expert weight와 token 이동
- 긴 컨텍스트 attention의 score·softmax 비용
- KV cache 용량과 decode 단계 메모리 대역폭
- GPU 간 all-to-all 통신
- 작은 의존 kernel들이 이어질 때의 전환 지연
- 랙 단위 전력 피크와 냉각 효율
Rubin은 이런 병목을 GPU 내부, 메모리, NVLink, 랙 전력 설계까지 함께 다룬다.
주요 아키텍처 변화
HBM4와 decode 대역폭
에이전트 추론은 decode 비중이 크고, decode는 메모리 대역폭에 민감하다. Rubin은 HBM4와 새 메모리 컨트롤러로 Blackwell 대비 더 높은 용량과 대역폭을 제공한다. 대형 모델과 긴 KV cache를 GPU 메모리에 유지할 수 있으면 offload와 통신 대기 시간이 줄어든다.
장문 attention 최적화
Rubin은 attention 중간값에 activation sparsity와 adaptive compression을 적용해 저장·이동 비용을 낮추고, softmax에서 exponential 처리량을 높인다. 긴 컨텍스트 모델에서 attention은 핵심 병목이므로, 이 최적화는 tokens/sec/user에 직접 영향을 준다.
MoE와 NVLink 통신
대형 MoE 모델은 expert별 weight와 token routing 때문에 GPU 간 통신이 중요하다. Rubin은 Tensor Memory Accelerator descriptor 처리, device-initiated NVLink counted writes, fused communication을 통해 expert-heavy inference의 데이터 이동 오버헤드를 줄인다.
랙 스케일 전력 설계
Vera Rubin NVL72는 액체 냉각, cable-free MGX rack architecture, Intelligent Power Smoothing, hot-swappable NVLink switch tray를 포함한다. NVIDIA는 전력 smoothing으로 평균 전력 소비와 50ms peak power를 낮추고, 같은 전력 envelope 안에서 더 많은 GPU를 운영하는 방향을 제시한다.
관련 문서
- ai-model-co-design — 하드웨어 친화적 LLM을 함께 설계하는 방법
- nvidia-cosmos — NVIDIA Cosmos 모델 생태계
- unified-memory — 로컬 LLM 하드웨어에서 용량과 속도를 가르는 메모리 구조
- llm-inference — LLM 추론이 작동하는 기본 흐름
참고 자료
- Inside NVIDIA Rubin GPU Architecture: Powering the Era of Agentic AI — NVIDIA Technical Blog (2026-07-22)