Nemotron 3.5 Lightning은 긴 작업을 수행하는 AI 에이전트에서 ‘어려운 판단’ 뒤에 이어지는 도구 호출·파일 읽기·검증 같은 반복 실행을 빠르게 처리하도록 만든 NVIDIA의 오픈 가중치 언어 모델이다. 큰 추론 모델 하나로 모든 단계를 처리하는 비용을 줄이고 싶은 에이전트 개발자에게 적합하다.
실행 모델이라는 위치
에이전트는 계획을 세운 뒤에도 명령 실행, 결과 읽기, 형식 변환, 테스트 재시도처럼 많은 턴을 소비한다. Lightning은 이 구간을 전담하는 실행 모델로 설계됐다. 복잡한 계획은 상위 모델이 맡고, 반복적이고 대량인 하위 작업을 Lightning에 라우팅하는 model-routing 구성이 대표적이다.
구조와 핵심 수치
| 항목 | 내용 |
|---|---|
| 전체 / 활성 파라미터 | 30B / 약 3B |
| 컨텍스트 창 | 최대 100만 토큰 |
| 구조 | Mamba-2 + MoE + 선택적 attention 하이브리드 |
| 입력·출력 | 텍스트 |
| 배포 | 오픈 가중치, NVIDIA API·Ollama·OpenRouter 등 |
MoE(mixture-of-experts)는 매 토큰에서 모든 30B 파라미터를 계산하지 않고 필요한 전문가 일부만 활성화한다. Mamba-2 계층은 긴 시퀀스를 전부 attention으로 처리하는 비용을 낮추고, 필요한 계층에는 attention을 남겨 먼 토큰 간 참조를 보완한다. multi-token prediction(MTP)과 speculative decoding은 여러 다음 토큰을 미리 제안해 생성 처리량을 높인다.
도입 시 확인할 점
- 역할을 분리한다: 취약점 판단, 아키텍처 결정처럼 실패 비용이 큰 단계는 더 강한 모델과 실제 검증에 남긴다.
- 동시성별로 측정한다: MTP와 draft model의 이점은 요청 동시성·하드웨어에 따라 달라진다.
- 양자화를 검증한다: NVIDIA는 NVFP4에서도 BF16에 가까운 결과를 보고하지만, 실제 도구 호출·한국어·코드베이스 데이터로 회귀 평가해야 한다.
관련 문서
- nemotron-3-ultra — Nemotron 3 계열의 고속 오픈 모델
- model-routing — 작업별로 서로 다른 LLM을 선택하는 운영 계층
- dflash — 생성 속도를 높이는 speculative decoding 기법
참고 자료
- NVIDIA Nemotron 3.5 Lightning: The AI Agent Workhorse — Analytics Vidhya (2026-08-17)