AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

LLM Post-training – 원시 모델을 제품형 AI 어시스턴트로 바꾸는 후학습

LLM Post-training은 사전학습(pretraining)으로 얻은 원시 언어 모델을 사람이 실제로 쓸 수 있는 AI 어시스턴트로 바꾸는 후학습 단계다. 지시 따르기, 대화 형식, 안전 거절, 도구 사용, 긴 추론 같은 “행동”은 대부분 이 단계에서 만들어진다.

Pretraining과 무엇이 다른가

구분PretrainingPost-training
목표다음 토큰 예측으로 일반 지식·언어 능력 학습특정 행동과 선호를 학습
데이터웹, 코드, 책, 문서 등 대규모 코퍼스데모 답변, 선호 비교, verifier 점수, 도구 사용 궤적
평가 신호perplexity, loss 등 비교적 명확한 수치도움됨, 안전함, 정확함, 추론 품질 같은 복합 목표
반복 속도대규모 장기 실험비교적 빠른 SFT부터 대규모 RL까지 폭이 큼

사전학습 모델은 지식을 많이 갖고 있어도 “질문에 답하라”는 행동을 안정적으로 하도록 훈련된 것이 아니다. GPT-3 초기 사용에서 few-shot Q&A 템플릿이 필요했던 이유도 여기에 있다. Post-training은 모델이 특정 chat template과 역할 토큰을 읽고, 사용자의 의도를 따르며, 답변 형식과 톤을 유지하게 만든다.

무엇을 바꾸는가

Post-training은 모델의 지식 전체를 새로 만드는 단계라기보다, 어떤 지식을 언제 꺼내고 어떻게 행동할지를 조정한다.

  • 사용성: 대화, 지시 따르기, 멀티턴 맥락 유지, 답변 형식 안정화
  • 안전성: 위험 요청 거절, 불확실성 표현, 유해 출력 감소
  • 능력: reasoning, verifier 기반 문제 풀이, 도구 사용, 함수 호출, 에이전트 행동
  • 제품 적합성: 브랜드 톤, 특정 업무 워크플로, 응답 길이, 시스템 정책 준수

예를 들어 모델이 역사 지식을 틀리게 알고 있다면 원인은 pretraining 데이터일 수 있다. 하지만 검색 도구를 쓰게 하거나, 모르면 불확실성을 표현하게 하거나, 답을 검증하게 만드는 것은 post-training 문제다.

주요 기법

기법역할
SFT(Supervised Fine-tuning)사람이 쓴 좋은 답변이나 도구 사용 예시를 따라 하게 만든다
Preference optimization두 답변 중 더 나은 답을 선호하게 만든다. DPO, RLHF 계열이 여기에 속한다
Verifier-based RL정답 검증이 가능한 수학·코딩·도구 작업에서 reward를 사용해 성능을 올린다
Safety tuning정책 위반 요청을 거절하고 경계 사례를 안정적으로 처리하게 한다
Tool-use tuning함수 호출, MCP, 검색, 코드 실행 같은 외부 도구 사용 패턴을 학습시킨다

최근 reasoning model에서는 post-training compute가 단순 정렬 단계를 넘어 모델 전체 compute의 큰 비중을 차지할 수 있다. 같은 base model이라도 후학습 데이터와 RL 캠페인에 따라 일반 instruct 모델과 reasoning 모델의 차이가 크게 벌어진다.

실무에서의 판단 기준

Post-training은 만능 지식 주입 수단이 아니다. 제품 개발자는 목적을 나눠 봐야 한다.

  • 최신 사내 지식이 필요하면 먼저 rag나 검색 도구를 검토한다.
  • 출력 형식, 톤, 분류·추출 패턴이 문제라면 SFT나 LoRA가 맞다.
  • 정답을 자동 검증할 수 있는 수학, 코드, SQL, 게임, 도구 작업은 verifier 기반 RL이 효과적일 수 있다.
  • 안전·정책 준수는 모델 후학습만 믿지 말고 런타임 필터와 권한 경계를 함께 둔다.
  • 도구 사용은 모델 학습보다 tool schema, 예시, 오류 메시지, 하네스 설계가 더 큰 영향을 줄 수 있다.

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)