AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Nemotron 3.5 Lightning – 에이전트 실행 단계를 겨냥한 30B 하이브리드 MoE 모델

Nemotron 3.5 Lightning은 긴 작업을 수행하는 AI 에이전트에서 ‘어려운 판단’ 뒤에 이어지는 도구 호출·파일 읽기·검증 같은 반복 실행을 빠르게 처리하도록 만든 NVIDIA의 오픈 가중치 언어 모델이다. 큰 추론 모델 하나로 모든 단계를 처리하는 비용을 줄이고 싶은 에이전트 개발자에게 적합하다.

실행 모델이라는 위치

에이전트는 계획을 세운 뒤에도 명령 실행, 결과 읽기, 형식 변환, 테스트 재시도처럼 많은 턴을 소비한다. Lightning은 이 구간을 전담하는 실행 모델로 설계됐다. 복잡한 계획은 상위 모델이 맡고, 반복적이고 대량인 하위 작업을 Lightning에 라우팅하는 model-routing 구성이 대표적이다.

구조와 핵심 수치

항목내용
전체 / 활성 파라미터30B / 약 3B
컨텍스트 창최대 100만 토큰
구조Mamba-2 + MoE + 선택적 attention 하이브리드
입력·출력텍스트
배포오픈 가중치, NVIDIA API·Ollama·OpenRouter 등

MoE(mixture-of-experts)는 매 토큰에서 모든 30B 파라미터를 계산하지 않고 필요한 전문가 일부만 활성화한다. Mamba-2 계층은 긴 시퀀스를 전부 attention으로 처리하는 비용을 낮추고, 필요한 계층에는 attention을 남겨 먼 토큰 간 참조를 보완한다. multi-token prediction(MTP)과 speculative decoding은 여러 다음 토큰을 미리 제안해 생성 처리량을 높인다.

도입 시 확인할 점

  • 역할을 분리한다: 취약점 판단, 아키텍처 결정처럼 실패 비용이 큰 단계는 더 강한 모델과 실제 검증에 남긴다.
  • 동시성별로 측정한다: MTP와 draft model의 이점은 요청 동시성·하드웨어에 따라 달라진다.
  • 양자화를 검증한다: NVIDIA는 NVFP4에서도 BF16에 가까운 결과를 보고하지만, 실제 도구 호출·한국어·코드베이스 데이터로 회귀 평가해야 한다.

관련 문서

  • nemotron-3-ultra — Nemotron 3 계열의 고속 오픈 모델
  • model-routing — 작업별로 서로 다른 LLM을 선택하는 운영 계층
  • dflash — 생성 속도를 높이는 speculative decoding 기법

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)