AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

같은 모델인데 결과가 다르다, DeepSeek V4 Flash가 보여준 추론 강도의 힘

“지능 대비 비용” 그래프에서 가장 매력적인 위치는 지능은 높으면서 비용은 낮은 왼쪽 위 구간입니다. DeepSeek의 신모델 V4 Flash 0731은 이 구간에 사실상 혼자 서 있습니다. 비슷한 지능의 다른 모델들은 대부분 열 배 넘는 비용을 요구하는데, 이 모델만 훨씬 저렴한 자리에 뚝 떨어져 있는 겁니다.

사진 출처: Artificial Analysis

벤치마크 업체 Artificial Analysis가 DeepSeek의 신모델 V4 Flash 0731을 자체 Intelligence Index로 측정한 결과를 발표했습니다. 지능 점수가 크게 오른 것은 물론, 가격까지 그대로 유지되며 지능 대비 비용 면에서 눈에 띄는 위치를 차지했다는 게 핵심입니다.

출처: DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index – Artificial Analysis

점수는 올랐고 가격은 그대로다

벤치마크 업체 Artificial Analysis에 따르면 DeepSeek V4 Flash 0731은 자체 Intelligence Index에서 50점을 받았죠. 이전 버전(40점)보다 10점 오른 수치로, GPT-5.6 Luna(51점)에 한 점 차로 따라붙었습니다. 에이전트 실무 작업 평가에서도 개선폭이 컸는데, 실제 업무형 태스크를 다루는 GDPval-AA v2 점수가 1189에서 1559로 뛰었고 터미널 작업 벤치마크인 Terminal-Bench 2.1은 17점 올라 79%를 기록했습니다.

그런데 이 모델의 가격은 이전 버전과 동일합니다. 입력 100만 토큰당 0.14달러, 출력 0.28달러입니다. OpenAI가 이날 GPT-5.6 Luna 가격을 80% 낮췄는데도, DeepSeek 자체 API 기준으로 작업당 비용은 여전히 GPT-5.6 Luna보다 약 60% 저렴하죠. 캐시에 걸린 토큰은 100만 개당 0.0028달러로, 98% 할인이 적용되는 구조 덕분입니다.

점수는 좋아졌는데, 정확도는 그대로였다

흥미로운 대목은 환각 관련 지표에서 나옵니다. AA-Omniscience 지수가 -23에서 -16으로 7점 개선됐는데, 이건 정답을 더 많이 맞혀서가 아니죠. 정확도(37%)는 이전과 완전히 같았습니다. 개선의 정체는 환각률이 95%에서 84%로 줄었다는 데 있습니다. 몰라도 아는 척 답하는 빈도가 줄었을 뿐, 실제로 아는 것 자체가 늘어난 건 아니라는 얘기입니다. 이 결과는 모델 크기가 284B 파라미터로 그대로라는 점과도 맞아떨어집니다.

벤치마크 총점만 보면 “더 똑똑해졌다”고 읽기 쉽지만, 점수를 끌어올린 구성 요소를 뜯어보면 이야기가 다르죠. 같은 실력으로 더 신중하게 답하게 된 모델과, 실력 자체가 늘어난 모델은 실제 사용 경험에서 꽤 다르게 느껴질 수 있습니다.

추론 강도를 얼마나 쓰느냐가 결과를 가른다

개발자 사이먼 윌리슨은 이 모델을 자신의 단골 테스트인 “펠리컨이 자전거 타는 그림 그리기”로 시험해봤습니다. 기본 추론 수준으로 OpenRouter를 통해 요청했을 때는 바퀴에 살이 없고 프레임이 붕 떠 있는 엉성한 그림이 나왔죠. 그런데 추론 강도를 “high”로 올려 같은 요청을 다시 보내자, 훨씬 정돈된 결과가 나왔습니다.

같은 모델, 같은 가격인데 설정 하나로 결과물의 완성도가 크게 갈린 셈입니다. DeepSeek V4 Flash 0731처럼 추론 강도를 조절할 수 있는 모델을 쓸 때는, 어떤 모델을 고르느냐 못지않게 그 모델을 어떤 강도로 돌리느냐가 실제 작업 품질을 좌우한다는 걸 보여주는 사례죠.

저렴한 프론티어급 모델의 시대

DeepSeek V4 Flash 0731은 오픈웨이트 최상위권인 Kimi K3(57점)에는 아직 7점 못 미치지만, 몇 주 안에 가중치가 공개될 예정이라 직접 구동해볼 수 있는 선택지로 남습니다. 비슷한 지능의 모델을 훨씬 싼값에 쓸 수 있는 옵션이 늘어나는 흐름 속에서, 이제 관건은 어떤 모델을 고르느냐만이 아니라 그 모델의 설정값을 얼마나 이해하고 쓰느냐로 옮겨가고 있는 셈입니다.

참고자료: deepseek-ai/DeepSeek-V4-Flash-0731


AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)

Comments

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다