같은 벤치마크 과제 하나를 푸는 데 한쪽은 건당 21.63달러, 다른 쪽은 0.24달러가 들었습니다. 90배 차이죠. 그런데 비싼 쪽이 더 많이 푸는 것도 아니었습니다.

Together AI가 DeepSeek V4 Pro 0813과 Claude Fable 5를 DeepSWE에서 맞붙인 기록을 공개했습니다. DeepSWE는 여러 언어와 과제 유형에 걸쳐 소프트웨어 엔지니어링 능력을 재는 벤치마크. 113개 과제를 두 모델로 각 4회씩, 총 904회 돌린 자체 측정 결과입니다.
출처: DeepSeek V4 Pro 0813 vs Claude Fable 5 on DeepSWE: Cost, Coding, and Routing – Together AI
첫 시도는 Fable, 두 번째부터는 Pro
한 번에 맞히는 능력은 Fable이 앞섭니다. pass@1이 69.7% 대 62.8%로 7점 차죠. 문제는 이 우위가 오래 버티지 못한다는 점입니다.
두 번 시도하면 Pro가 78.5%로 Fable의 77.1%를 따라잡습니다. 네 번이면 88.5% 대 84.1%, 4점 넘게 벌어진 겁니다. 90배 비싼 모델이 천장을 쥐고 있지도, 첫 시도 우위를 재시도 속에서 지켜내지도 못한다는 뜻입니다.
속도로 값을 하는 것도 아닙니다. 롤아웃 중앙값은 Pro 35분, Fable 31분으로 거의 붙어 있죠. Fable은 스텝 수가 79로 Pro의 146보다 훨씬 적은데, 스텝당 쏟아내는 출력이 많아 결국 시간이 비슷해집니다.
두 모델은 다른 문제에서 틀린다
여기가 이 비교의 핵심입니다. 두 모델의 과제별 상관계수는 0.39로, Together AI가 측정한 조합 중 가장 낮았죠.
숫자를 풀어보면 이렇습니다. 88개는 둘 다 풀었고, Pro만 푼 게 12개, Fable만 푼 게 7개, 둘 다 못 푼 건 6개뿐. 합치면 113개 중 107개, 94.7%를 덮습니다.
같은 실력을 두 번 사는 게 아니라 서로 다른 실력을 사는 셈. 라우팅이 성립하는 이유가 여기 있습니다.
순서를 바꾸면 값이 바뀐다
캐스케이드는 이렇게 돌아갑니다. DeepSeek V4 Pro 0813을 먼저 돌리고, 테스트 스위트가 결과를 거부할 때만 Claude Fable 5로 올리는 방식.
결과는 82.7%를 건당 8.28달러. Fable 단독은 69.7%를 21.63달러에 냈으니, 13%p 더 풀면서 비용은 절반 이하로 내려간 겁니다. 완벽하게 예측하는 1샷 오라클 라우터(78.8%)보다도 높았죠.
순서는 바꿀 수 있는 게 아닙니다. Fable을 먼저 세우면 같은 정확도에 21.71달러가 들죠. 싼 1단계가 대기열 대부분을 걷어내야 비싼 값이 남은 소수에만 붙기 때문입니다.
90배를 낼 만한 자리
Fable이 값을 하는 구간은 분명합니다. Rust에서 85% 대 65%로 20점을 벌리고, 데이터 모델링과 직렬화에서 88%로 24점 앞서죠. 8개 과제 도메인 중 6개를 가져갑니다.
Pro가 이기는 자리도 있습니다. TypeScript(61 대 57), 상태 반응성(66 대 64), 그리고 동시성과 내구성(58 대 45). 마지막 항목은 Fable의 가장 약한 칸이라, 여기서만큼은 싼 모델이 그냥 더 나은 엔지니어입니다.
틀리는 방식도 다릅니다. 기존 테스트를 깨뜨리는 비율은 둘 다 11%로 같지만, Fable은 크게 빗나가는 실패가 18%로 Pro의 10%보다 높죠. Pro 쪽은 아깝게 못 맞히는 실패가 66%로 더 흔합니다. 같은 실패라도 Fable 쪽이 디버깅 비용이 큰 겁니다.
정가표가 아니라 배치를 보는 문제
이 결과에서 읽을 건 “어느 모델이 더 좋은가”가 아닙니다. 90배 프리미엄이 무엇을 사주는지, 그게 내 작업에 있는 항목인지죠.
Rust와 직렬화 위주라면 프리미엄에 근거가 있죠. 그 바깥이라면 같은 돈으로 싼 모델을 여러 번 굴리는 편이 더 많이 풉니다. Pro는 100달러당 260개를 풀고 Fable은 3개를 푸니까.
다만 캐스케이드 전체가 하나의 전제 위에 서 있다는 점은 짚어둘 만합니다. 1단계 결과가 틀렸다는 걸 자동으로 판정할 수단, 그러니까 믿을 만한 테스트 스위트가 있어야 성립하죠. 사람이 눈으로 검수해야 하는 작업이라면 이 계산은 처음부터 다시 해야 합니다.
해보려면
환경: DeepSWE 113개 과제, 두 모델 모두 max 설정, 과제당 4회 시행(총 904 롤아웃). Together AI 플랫폼에서 잰 자체 측정치이므로 다른 공개 스코어카드와 다를 수 있습니다.
출발점: 1단계에 DeepSeek V4 Pro 0813을 두고, 테스트가 실패할 때만 Claude Fable 5로 승격. 순서를 뒤집으면 같은 정확도에 21.71달러
확인: 1단계 통과율이 높게 유지되는지. 승격 비율이 올라가면 건당 비용이 8.28달러에서 빠르게 멀어집니다
걸리는 지점: 결과를 자동 판정할 테스트 스위트가 없으면 캐스케이드 자체가 성립하지 않음. Rust·직렬화 비중이 높은 코드베이스라면 1단계 통과율이 떨어져 절감 폭도 줄어듭니다

답글 남기기