AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

NVIDIA Rubin – 에이전틱 AI 추론을 겨냥한 차세대 GPU 아키텍처

NVIDIA Rubin은 Vera Rubin 플랫폼의 중심 GPU 아키텍처로, 장문 추론·도구 사용·검증을 반복하는 에이전틱 AI 워크로드를 겨냥한다. NVIDIA는 Rubin이 Blackwell 대비 단위 에너지당 에이전틱 처리량을 최대 10배 높인다고 설명한다.

핵심 스펙

항목내용
트랜지스터3360억 개
SM / Tensor Core224 SM, 896 Tensor Core
저정밀 연산3세대 Transformer Engine, 최대 50 PFLOPS NVFP4 inference
메모리GPU당 최대 288GB HBM4, 최대 22TB/s 대역폭
GPU 간 통신NVLink 6, NVLink Switch 연결 기준 3,600GB/s scale-up bandwidth
랙 시스템Vera Rubin NVL72, 액체 냉각, 전력 smoothing, hot-swappable NVLink switch tray

왜 에이전틱 AI용인가

에이전틱 워크로드는 한 번의 prompt-response보다 길다. 모델이 계획을 세우고, 도구를 호출하고, 중간 결과를 검증하고, 긴 컨텍스트를 유지하며 여러 단계의 추론을 반복한다. 이때 병목은 단순 GEMM 성능만이 아니다.

  • MoE 모델의 expert weight와 token 이동
  • 긴 컨텍스트 attention의 score·softmax 비용
  • KV cache 용량과 decode 단계 메모리 대역폭
  • GPU 간 all-to-all 통신
  • 작은 의존 kernel들이 이어질 때의 전환 지연
  • 랙 단위 전력 피크와 냉각 효율

Rubin은 이런 병목을 GPU 내부, 메모리, NVLink, 랙 전력 설계까지 함께 다룬다.

주요 아키텍처 변화

HBM4와 decode 대역폭

에이전트 추론은 decode 비중이 크고, decode는 메모리 대역폭에 민감하다. Rubin은 HBM4와 새 메모리 컨트롤러로 Blackwell 대비 더 높은 용량과 대역폭을 제공한다. 대형 모델과 긴 KV cache를 GPU 메모리에 유지할 수 있으면 offload와 통신 대기 시간이 줄어든다.

장문 attention 최적화

Rubin은 attention 중간값에 activation sparsity와 adaptive compression을 적용해 저장·이동 비용을 낮추고, softmax에서 exponential 처리량을 높인다. 긴 컨텍스트 모델에서 attention은 핵심 병목이므로, 이 최적화는 tokens/sec/user에 직접 영향을 준다.

대형 MoE 모델은 expert별 weight와 token routing 때문에 GPU 간 통신이 중요하다. Rubin은 Tensor Memory Accelerator descriptor 처리, device-initiated NVLink counted writes, fused communication을 통해 expert-heavy inference의 데이터 이동 오버헤드를 줄인다.

랙 스케일 전력 설계

Vera Rubin NVL72는 액체 냉각, cable-free MGX rack architecture, Intelligent Power Smoothing, hot-swappable NVLink switch tray를 포함한다. NVIDIA는 전력 smoothing으로 평균 전력 소비와 50ms peak power를 낮추고, 같은 전력 envelope 안에서 더 많은 GPU를 운영하는 방향을 제시한다.

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)