GPT
AI에게 “전문가처럼” 물으면 재무 조언 품질이 달라진다, MIT 연구
MIT 슬론 연구팀이 GPT와 Gemini의 재무 조언 품질을 측정했습니다. AI 조언은 예상보다 좋았지만, 질문을 얼마나 구체적으로 하느냐에 따라 결과가 크게 갈렸습니다. 프롬프트 방식이 조언의 질을 어떻게 좌우하는지 소개합니다.
Written by

AI가 펠리컨 그림 연습을 몰래 했다는 의혹, 1,008장 그려보니 근거가 없었다
AI 회사들이 유명 펠리컨 벤치마크에 맞춰 몰래 학습시켰다는 의혹을 1,008장의 SVG로 검증한 실험. 결과는 뚜렷한 조작 흔적 없음이었습니다.
Written by

같은 TypeScript 파일인데 Claude가 GPT보다 토큰을 73% 더 씁니다
같은 TypeScript 코드도 벤더 토크나이저에 따라 토큰 수가 최대 73% 차이 난다는 실측. 목록가 뒤에 숨은 실질 API 비용을 짚어봅니다.
Written by

GPT·Claude API를 90% 싸게 쓸 수 있다는 말, 그 할인은 어디서 오는가
90% 저렴한 GPT·Claude API 프록시의 실체. 모델 스와핑과 계정 어뷰징으로 만든 할인이 코딩 에이전트에 연결될 때 왜 특히 위험한지 다룹니다.
Written by

AI 경쟁의 승자는 최고 모델이 아니라 가장 널리 쓰는 쪽
최고 성능 모델을 좇는 경쟁보다, 지금 쓰는 도구를 얼마나 깊이 체화했는지가 진짜 경쟁력이라는 확산이론 이야기.
Written by

5개 최상위 AI, 같은 뉴스 팩트체크하면 67%는 의견이 갈린다
최상위 LLM 5개에 동일한 팩트체크 주장 1,000개를 제시한 결과, 67%에서 모델 간 판정이 엇갈렸습니다. AI 팩트체킹 신뢰성의 실제 한계를 데이터로 보여주는 연구입니다.
Written by

AI 모델마다 윤리 기준이 다르다, Philosophy Bench 100개 딜레마 분석
100개 윤리 딜레마로 AI 모델의 도덕적 성향을 측정한 Philosophy Bench 분석. Claude는 거짓말보다 거절을, Grok은 요청 수행을 택하는 등 모델마다 뚜렷한 차이를 보입니다.
Written by

GPT-5.5 제대로 쓰려면 프롬프트 처음부터 다시 짜야 한다
OpenAI가 GPT-5.5 출시와 함께 공개한 공식 프롬프팅 가이드 핵심 정리. 기존 프롬프트를 그대로 이식하면 역효과가 나는 이유와 outcome-first 프롬프팅의 원칙을 소개합니다.
Written by

Claude에서 GPT-5.4로, 모델 갈아타기 전에 해야 할 일
Anthropic의 OpenClaw 가격 정책 변화로 많은 개발자가 GPT-5.4로 전환을 고민 중입니다. 하지만 실전 테스트 결과, 모델 자체보다 프롬프트 튜닝이 더 중요했습니다. 현명한 모델 선택을 위한 실무 가이드입니다.
Written by

Sora가 망한 진짜 이유, AI 영상 생성의 수익 불가능 구조
OpenAI가 Sora를 6개월 만에 종료한 이유를 수치로 분석. 하루 비용 $1,500만 vs. 총 매출 $210만, AI 영상이 텍스트보다 160배 비싼 구조적 이유를 설명합니다.
Written by
