LLM은 왜 50년 된 알고리즘에마저 지는가, 표 데이터의 숨은 변수
SQL도 짜고 대학원 시험도 통과하는 LLM이 유독 엑셀 표 예측에서는 50년 전 알고리즘에 집니다. 연구진이 5가지 가설을 하나씩 검증한 끝에 찾아낸 진짜 원인은 데이터의 노이즈도, 형식도 아니었습니다.
Written by
프레임 3만 장 대신 12KB, 코딩 에이전트를 영상 편집기로 만든 video-use
원본 푸티지를 폴더에 넣고 Claude Code와 대화하면 완성본이 나오는 오픈소스가 공개됐습니다. 비결은 모델이 영상을 보지 않고 읽는다는 설계죠. 프레임을 통째로 넘기면 4,500만 토큰인 작업을 12KB 텍스트로 처리하는 방법을 정리했습니다.
Written by
깃허브 엔지니어가 짚은 프롬프트의 진짜 변수, 도메인 지식
같은 ChatGPT인데 수학자 테런스 타오의 대화는 왜 다르게 흘러갈까요. 깃허브 엔지니어 션 괴데케는 프롬프트 기교가 아니라 도메인 지식이 진짜 변수라고 말합니다. 모델이 강해져도 병목은 여전히 사람 쪽이라는 이야기.
Written by
SQLite 취약점 보고서 55건 중 54건이 가짜, AI가 만든 CVE가 뚫은 검증 공백
신규 깃허브 계정이 올린 SQLite 취약점 보고서에 NVD가 심각 등급을 붙였고 CISA도 동의했습니다. 그런데 인용된 함수는 그 버전에 존재하지도 않았죠. JFrog가 55건을 전수 검증한 결과 54건이 조작이었고, 이 사고가 드러낸 건 취약점 파이프라인의 구조적 공백입니다.
Written by
MiniMax H3 오픈웨이트 공개, 2K 영상과 스테레오 사운드가 한 번에 나온다
대사와 효과음이 그림과 같은 패스에서 나오는 2K 영상 모델이 오픈웨이트로 풀렸습니다. 전체 정밀도로 123.6GB인 이 모델이 RTX 3060에서 돌아가게 된 건 파라미터 40%를 룩업 테이블로 바꾼 덕이었죠. MiniMax H3가 무엇이고 어디까지 확인됐는지 정리했습니다.
Written by
LLM에게 파일을 못 건드리게 했다, 인지 부채를 막는 어느 개발자의 규칙
로봇이 PR을 올리고 사람이 리뷰하는 게 2026년의 기본값이죠. 그런데 어떤 개발자는 어시스턴트에게 파일을 아예 못 건드리게 하고 모든 코드를 손으로 다시 타이핑합니다. 10배 대신 2배를 택하고 얻은 건 코드베이스의 공간 지도였습니다.
Written by
1.8달러 모델이 104달러 모델을 이겼다, 버그 105개로 돌려본 실측
실제 저장소에 숨긴 버그 105개를 프론티어 모델 10종에 돌린 결과, 33개를 고친 Luna는 1.8달러를 썼고 29개를 고친 Fable 5는 104달러를 썼습니다. 같은 모델이라도 추론 강도만 바꾸면 수정 개수가 13개에서 33개로 벌어졌고요. 개인이 만든 벤치마크가 드러낸 AI 코딩 비용의 실제 구조.
Written by
같은 모델인데 결과가 다르다, DeepSeek V4 Flash가 보여준 추론 강도의 힘
DeepSeek V4 Flash 0731이 지능 대비 비용에서 독보적 위치를 차지했습니다. 그런데 벤치마크 개선의 실체와, 같은 모델도 추론 강도 설정에 따라 결과가 크게 갈린다는 사이먼 윌리슨의 실험을 함께 짚어봅니다.
Written by
AI에게 “전문가처럼” 물으면 재무 조언 품질이 달라진다, MIT 연구
MIT 슬론 연구팀이 GPT와 Gemini의 재무 조언 품질을 측정했습니다. AI 조언은 예상보다 좋았지만, 질문을 얼마나 구체적으로 하느냐에 따라 결과가 크게 갈렸습니다. 프롬프트 방식이 조언의 질을 어떻게 좌우하는지 소개합니다.
Written by
AI 추론 과정의 절반을 지워도 답은 그대로 나온다
AI가 답을 내기 전 보여주는 “생각의 사슬” 중 상당수는 실제 답변과 인과관계가 없다는 연구 결과가 나왔습니다. 절반을 지워도 성능이 유지된다는 실험을 통해, AI 추론 과정을 얼마나 믿어야 할지 짚어봅니다.
Written by









