LLM Post-training은 사전학습(pretraining)으로 얻은 원시 언어 모델을 사람이 실제로 쓸 수 있는 AI 어시스턴트로 바꾸는 후학습 단계다. 지시 따르기, 대화 형식, 안전 거절, 도구 사용, 긴 추론 같은 “행동”은 대부분 이 단계에서 만들어진다.
Pretraining과 무엇이 다른가
| 구분 | Pretraining | Post-training |
|---|---|---|
| 목표 | 다음 토큰 예측으로 일반 지식·언어 능력 학습 | 특정 행동과 선호를 학습 |
| 데이터 | 웹, 코드, 책, 문서 등 대규모 코퍼스 | 데모 답변, 선호 비교, verifier 점수, 도구 사용 궤적 |
| 평가 신호 | perplexity, loss 등 비교적 명확한 수치 | 도움됨, 안전함, 정확함, 추론 품질 같은 복합 목표 |
| 반복 속도 | 대규모 장기 실험 | 비교적 빠른 SFT부터 대규모 RL까지 폭이 큼 |
사전학습 모델은 지식을 많이 갖고 있어도 “질문에 답하라”는 행동을 안정적으로 하도록 훈련된 것이 아니다. GPT-3 초기 사용에서 few-shot Q&A 템플릿이 필요했던 이유도 여기에 있다. Post-training은 모델이 특정 chat template과 역할 토큰을 읽고, 사용자의 의도를 따르며, 답변 형식과 톤을 유지하게 만든다.
무엇을 바꾸는가
Post-training은 모델의 지식 전체를 새로 만드는 단계라기보다, 어떤 지식을 언제 꺼내고 어떻게 행동할지를 조정한다.
- 사용성: 대화, 지시 따르기, 멀티턴 맥락 유지, 답변 형식 안정화
- 안전성: 위험 요청 거절, 불확실성 표현, 유해 출력 감소
- 능력: reasoning, verifier 기반 문제 풀이, 도구 사용, 함수 호출, 에이전트 행동
- 제품 적합성: 브랜드 톤, 특정 업무 워크플로, 응답 길이, 시스템 정책 준수
예를 들어 모델이 역사 지식을 틀리게 알고 있다면 원인은 pretraining 데이터일 수 있다. 하지만 검색 도구를 쓰게 하거나, 모르면 불확실성을 표현하게 하거나, 답을 검증하게 만드는 것은 post-training 문제다.
주요 기법
| 기법 | 역할 |
|---|---|
| SFT(Supervised Fine-tuning) | 사람이 쓴 좋은 답변이나 도구 사용 예시를 따라 하게 만든다 |
| Preference optimization | 두 답변 중 더 나은 답을 선호하게 만든다. DPO, RLHF 계열이 여기에 속한다 |
| Verifier-based RL | 정답 검증이 가능한 수학·코딩·도구 작업에서 reward를 사용해 성능을 올린다 |
| Safety tuning | 정책 위반 요청을 거절하고 경계 사례를 안정적으로 처리하게 한다 |
| Tool-use tuning | 함수 호출, MCP, 검색, 코드 실행 같은 외부 도구 사용 패턴을 학습시킨다 |
최근 reasoning model에서는 post-training compute가 단순 정렬 단계를 넘어 모델 전체 compute의 큰 비중을 차지할 수 있다. 같은 base model이라도 후학습 데이터와 RL 캠페인에 따라 일반 instruct 모델과 reasoning 모델의 차이가 크게 벌어진다.
실무에서의 판단 기준
Post-training은 만능 지식 주입 수단이 아니다. 제품 개발자는 목적을 나눠 봐야 한다.
- 최신 사내 지식이 필요하면 먼저 rag나 검색 도구를 검토한다.
- 출력 형식, 톤, 분류·추출 패턴이 문제라면 SFT나 LoRA가 맞다.
- 정답을 자동 검증할 수 있는 수학, 코드, SQL, 게임, 도구 작업은 verifier 기반 RL이 효과적일 수 있다.
- 안전·정책 준수는 모델 후학습만 믿지 말고 런타임 필터와 권한 경계를 함께 둔다.
- 도구 사용은 모델 학습보다 tool schema, 예시, 오류 메시지, 하네스 설계가 더 큰 영향을 줄 수 있다.
관련 문서
- llm-fine-tuning — SFT·PEFT·LoRA·QLoRA를 포함한 파인튜닝 가이드
- agent-rl-training-frameworks — 에이전트 작업용 RL 학습 프레임워크 비교
- reasoning-effort-tips-control — 추론 노력과 inference-time compute 조절
- agent-harness — 모델 외부 실행 환경이 에이전트 성능을 좌우하는 구조
- rag — 지식 갱신을 검색 계층으로 처리하는 방식
참고 자료
- Introduction to Post-training — O’Reilly Radar (2026-08-05)