AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

1.8달러 모델이 104달러 모델을 이겼다, 버그 105개로 돌려본 실측

버그 33개를 고치는 데 1.8달러가 들었습니다. 29개를 고친 쪽은 104달러를 썼고요. 같은 벤치마크, 같은 버그 목록에서 나온 숫자입니다.

사진 출처: The Product Compass

Product Compass 뉴스레터를 쓰는 파베우 후린이 몇 주에 걸쳐 다듬어온 Bug Hunt Bench의 7번째 버전 결과입니다. 실제 저장소 두 곳에 숨긴 버그 105개를 프론티어 모델 10종에 돌렸죠. OpenAI가 7월 30일 GPT-5.6 Luna 가격을 80% 내린 직후에 측정한 수치입니다.

출처: How to Cut Your AI Coding Bill to $20/Month – The Product Compass

먼저 조건을 하나 밝혀두죠. 이건 한 사람이 만들고 혼자 돌린 벤치마크입니다. 실행 기록과 방법은 깃허브에 공개돼 있지만 정답지는 비공개라, 제3자가 그대로 재현하긴 어렵습니다. 아래 숫자는 그 전제 위에서 읽어야 합니다.

추론 강도 하나가 버그 20개를 갈랐다

상위 결과부터 보죠. GPT-5.6 Sol을 최대 추론으로 돌렸을 때 42개를 고쳤고 69.61달러가 나왔습니다. Luna 최대는 33개에 1.80달러. Fable 5 최대는 29개에 104.49달러였죠.

더 눈에 띄는 건 Luna 안에서의 차이입니다. 같은 Luna를 high 강도로 돌리면 수정 개수가 13개로 떨어집니다. max에서는 33개였고요. 모델을 바꾼 게 아니라 추론 강도만 옮겼는데 두 배 반 넘게 벌어진 겁니다.

저자는 이걸 두고 Luna의 max와 high는 사실상 다른 모델이라고 표현합니다.

격차는 대부분 요금표에서 나온다

왜 이렇게까지 차이가 날까요. 상당 부분은 그냥 가격표입니다.

백만 토큰 기준으로 Opus 5와 GPT-5.6 Luna를 나란히 놓으면 이렇습니다. 입력은 5달러 대 0.20달러. 캐시된 입력은 0.50달러 대 0.02달러. 출력은 25달러 대 1.20달러죠. 토큰 종류를 가리지 않고 20~25배 차이가 납니다.

실제 측정에서는 편차가 더 컸습니다. 설정과 세션 길이에 따라 20배에서 90배까지 벌어졌죠. 저자는 앤트로픽의 100만 토큰 컨텍스트 세션이 이 상황을 더 나쁘게 만든다고 봅니다. 컨텍스트를 캐시에 쓰고 읽는 데 계속 돈이 붙으니까요.

세션이 데워지면 그림이 바뀐다

단발 호출과 대화 중반은 조건이 다릅니다. 저자는 같은 질문을 두 방식으로 던져 중앙값을 재봤습니다.

콜드 스타트, 그러니까 대화를 새로 시작해 한 번만 묻는 경우입니다. Opus 5 high는 8.1초에 10.10센트가 들었습니다. Luna max는 22.6초에 0.11센트였고요.

세션 중반, 그러니까 한 대화의 2~6번째 턴에서는 양쪽 다 싸집니다. Opus 5는 지시사항을 매번 다시 올리지 않아도 되니 약 4배 떨어져 2.79센트가 됐죠. Luna는 절반쯤인 0.06센트. 90배쯤 벌어져 있던 격차가 40배 근처로 좁혀집니다.

대신 시간을 내줘야 합니다. Luna 최대 추론은 Opus 5 high보다 느립니다. 콜드 스타트 기준으로 22.6초 대 8.1초니까 체감 차이가 작지 않죠.

싸다고 다 되는 건 아니다

예상이 빗나간 항목도 있습니다. fast mode는 API에서 2배, ChatGPT 크레딧 기준 2.5배를 받고 1.5배 빨라진다고 안내되는 옵션이죠. 저자가 돌린 모든 테스트에서 Luna에는 측정 가능한 차이가 나타나지 않았습니다.

더 무거운 숫자는 따로 있습니다. 105개 버그 중 53개는 어떤 모델도, 어떤 실행에서도 못 고쳤습니다. 절반이 넘죠. 다만 무작위로 만든 버그가 아니라 2026년 1월부터 7월 사이 프론티어 모델들이 실제로 놓친 버그와 그 변형들이라, 애초에 실패가 기본값에 가까운 문제 모음이었습니다.

저자 본인의 선택도 참고할 만합니다. 그는 여전히 여러 구독을 유지하고, 판단이 필요한 일이나 글쓰기에는 가장 비싼 모델을 붙입니다. 정작 그 가장 비싼 모델은 코드를 아예 건드리지 않는다는 게 그의 정리죠.

순위표가 아니라 조건표

이 실험이 가리키는 건 어떤 모델이 제일 낫다는 결론이 아닙니다. 같은 작업이라도 추론 강도를 어디에 두느냐, 세션이 데워져 있느냐에 따라 비용이 수십 배씩 움직인다는 쪽에 가깝죠.

월 20달러 구독으로 진짜 작업을 돌릴 수 있게 됐다는 저자의 주장도 이 조건 안에서만 성립합니다. 느린 걸 견딜 수 있고, 강도 설정을 직접 만질 수 있고, 절반은 못 고칠 수 있다는 걸 감안한다면.

써보려면

필요한 것: ChatGPT Plus 구독(월 20달러). Luna는 이 요금제에 포함되며, 저자는 발행 전에 두 번째 계정을 따로 만들어 Plus에서 설명한 기능이 전부 되는지 확인했다고 밝힙니다.

시작 지점: 데스크톱 앱의 Codex 모드에서 추론 강도 설정을 엽니다. max는 기본값이 아니라 따로 켜야 하는 옵션입니다. 이걸 건드리지 않으면 위의 33개가 아니라 13개 쪽 결과를 보게 됩니다.

잘 맞는 상황 / 안 맞는 상황: 저자는 기획, 대규모 구현, 밤새 돌려두는 비동기 작업처럼 기다려줄 수 있는 일에 Luna max를 씁니다. 버그 수정이나 요약 같은 일상 작업에는 Luna high를 권하고요. 응답이 몇 초 안에 와야 하는 대화형 작업에는 속도 때문에 잘 맞지 않습니다.

참고자료:


AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)

Comments

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다