Granite 4.2는 IBM이 공개한 조밀형(decoder-only dense) 추론 모델군이다. 3B·8B·30B 세 크기 모두 사고 모드와 비사고 모드, 네이티브 도구 호출을 제공하며, 특히 8B·30B는 실제 샌드박스에서 터미널·웹·코드를 다루는 에이전틱 강화학습(RL)을 거쳤다. Apache 2.0 조건으로 내부망 도구 에이전트를 실험하려는 팀에 유용한 선택지다.
모델별로 달라지는 범위
| 모델 | 공통 기능 | 추가 후학습 |
|---|---|---|
| 3B | 사고·비사고·low-effort 모드, 도구 호출 | 일반 추론·구조화 출력 RL |
| 8B | 위와 같음 | 실제 환경의 도구·터미널·웹 작업 에이전틱 RL |
| 30B | 위와 같음 | 에이전틱 코딩 SFT와 에이전틱 RL 확대 |
세 모델은 약 15조 토큰으로 사전학습했고, 5단계 학습의 마지막 단계에서 컨텍스트 창을 512K 토큰까지 늘렸다. 긴 입력을 받을 수 있다는 사실만으로 장기 작업 품질이 보장되지는 않으므로, 실제 도입에서는 컨텍스트 예산과 검색·압축 정책을 따로 둬야 한다.
학습 설계에서 볼 점
사후학습은 수학·코드·과학·지시 이행·도구 사용·구조화 출력에서 시작해 소프트웨어 엔지니어링, 터미널, 웹 검색 환경으로 이어지는 다단계 RL이다. 각 단계는 앞 단계 체크포인트에서 이어받고, 비동기 GRPO로 생성 작업자와 학습 작업자를 병렬화한다.
따라서 모델을 선택할 때는 단일 벤치마크 점수보다 다음을 확인해야 한다.
- 단순 JSON 출력이면 3B도 후보가 될 수 있지만, 여러 도구와 파일 편집이 필요한 작업은 8B 이상으로 평가한다.
- OpenAI 호환 서버에서 함수 호출 형식이 애플리케이션의 스키마·파서와 맞는지 테스트한다.
- 모델의 에이전틱 RL은 권한 정책을 대체하지 않는다. 도구 실행은 하네스의 샌드박스와 승인 경계 안에 둔다.
관련 문서
- glm-5-3 — 장기 작업 환경 후학습을 확장한 Z.ai 모델
- local-slm-tips-tool-calling-models — 제한된 하드웨어에서 도구 호출 모델을 고르는 기준
- agent-harness — 모델 밖 실행 환경과 안전 경계 설계
참고 자료
- Granite 4.2 LLMs: How They’re Built — IBM Granite / Hugging Face (2026-08-27)