Mistral OCR 4.1은 텍스트를 읽는 데 그치지 않고 문단 수준 바운딩 박스(bounding box), 구조 블록 라벨, 블록별 신뢰도 점수까지 반환하는 Mistral의 Document AI용 OCR 서비스다. PDF·스캔 문서를 검색 가능한 텍스트로 바꾸면서 원본 레이아웃과 검수 우선순위도 보존해야 하는 팀에 적합하다.
세 가지 출력이 중요한 이유
| 출력 | 활용 | 없을 때 생기는 문제 |
|---|---|---|
| 문단 좌표 | 원본 페이지에서 인용·오류 위치를 바로 표시 | 사람이 해당 문장을 다시 찾기 어렵다 |
| 구조 블록 라벨 | 제목·본문·표 등 후속 파싱 경로를 분리 | 평면 텍스트에 표와 제목이 뒤섞인다 |
| 신뢰도 점수 | 낮은 품질 블록만 사람 검수 또는 재처리 | 모든 결과를 동일한 비용으로 검수한다 |
따라서 OCR 결과를 RAG에 넣을 때도 텍스트만 임베딩하지 말고 페이지, 블록 유형, 좌표, 신뢰도를 메타데이터로 함께 보관하는 편이 좋다. 답변의 근거 위치를 보여 주거나 불확실한 블록을 검색에서 제외하는 정책을 만들 수 있다.
권장 파이프라인
- 문서를 페이지 또는 배치 단위로 OCR에 보낸다.
- 구조 라벨에 따라 본문·표·제목 처리를 분기한다.
- 신뢰도가 낮은 블록은 재시도 또는 사람 검수 대기열로 보낸다.
- 검증된 텍스트와 원본 좌표를 함께 색인한다.
금융·법률·의료처럼 한 글자 오류의 비용이 큰 문서에서는 신뢰도 점수를 정답 보증으로 해석하면 안 된다. 숫자, 표, 서명, 필기처럼 오류가 집중되는 영역에 별도 검증 규칙을 둬야 한다.
누구에게 적합한가
- 문서 자동화 팀: 스캔 PDF에서 추출한 내용을 업무 시스템에 넣을 때
- RAG 개발자: 답변 근거를 원본 문서 위치까지 추적해야 할 때
- 검수 운영팀: 전체 문서를 수동 검토하지 않고 위험 블록만 선별할 때
관련 문서
- rag — 외부 문서를 검색 가능한 지식으로 사용하는 방식
- rag-tips-image-indexing — 이미지와 문서를 RAG 색인에 넣는 방법
- unstract — 비정형 문서를 JSON·API·ETL 파이프라인으로 바꾸는 플랫폼
참고 자료
- OCR 4.1 — Mistral AI 공식 문서 (2026-07-16)