AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Granite 4.2 – 512K 컨텍스트와 에이전틱 RL을 결합한 오픈 추론 모델

Granite 4.2는 IBM이 공개한 조밀형(decoder-only dense) 추론 모델군이다. 3B·8B·30B 세 크기 모두 사고 모드와 비사고 모드, 네이티브 도구 호출을 제공하며, 특히 8B·30B는 실제 샌드박스에서 터미널·웹·코드를 다루는 에이전틱 강화학습(RL)을 거쳤다. Apache 2.0 조건으로 내부망 도구 에이전트를 실험하려는 팀에 유용한 선택지다.

모델별로 달라지는 범위

모델공통 기능추가 후학습
3B사고·비사고·low-effort 모드, 도구 호출일반 추론·구조화 출력 RL
8B위와 같음실제 환경의 도구·터미널·웹 작업 에이전틱 RL
30B위와 같음에이전틱 코딩 SFT와 에이전틱 RL 확대

세 모델은 약 15조 토큰으로 사전학습했고, 5단계 학습의 마지막 단계에서 컨텍스트 창을 512K 토큰까지 늘렸다. 긴 입력을 받을 수 있다는 사실만으로 장기 작업 품질이 보장되지는 않으므로, 실제 도입에서는 컨텍스트 예산과 검색·압축 정책을 따로 둬야 한다.

학습 설계에서 볼 점

사후학습은 수학·코드·과학·지시 이행·도구 사용·구조화 출력에서 시작해 소프트웨어 엔지니어링, 터미널, 웹 검색 환경으로 이어지는 다단계 RL이다. 각 단계는 앞 단계 체크포인트에서 이어받고, 비동기 GRPO로 생성 작업자와 학습 작업자를 병렬화한다.

따라서 모델을 선택할 때는 단일 벤치마크 점수보다 다음을 확인해야 한다.

  • 단순 JSON 출력이면 3B도 후보가 될 수 있지만, 여러 도구와 파일 편집이 필요한 작업은 8B 이상으로 평가한다.
  • OpenAI 호환 서버에서 함수 호출 형식이 애플리케이션의 스키마·파서와 맞는지 테스트한다.
  • 모델의 에이전틱 RL은 권한 정책을 대체하지 않는다. 도구 실행은 하네스의 샌드박스와 승인 경계 안에 둔다.

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)