AI 기술 분석
AI 에이전트 명령 승인, 사람은 위협 3건 중 1건을 놓쳤다
코딩 에이전트의 명령을 사람이 승인하는 방식, 정말 안전한 걸까요. 4만 판 40만 건의 판단을 모아보니 위협 3건 중 1건이 그대로 통과했습니다. npm run 뒤에 숨긴 코드가 왜 두 배로 잘 먹히는지, 그리고 Zed가 샌드박싱을 기본값으로 켠 이유를 짚었습니다.
Written by

하네스가 스스로를 고치기 시작했다, 자기개선 루프의 현재 좌표
에이전트를 개선한다는 건 지금까지 사람이 프롬프트와 도구를 손보는 일이었습니다. 그런데 최근 나온 하네스들은 그 손보는 일 자체를 에이전트에게 넘기죠. 1965년 재귀적 자기개선 개념이 어떻게 2026년의 코딩 하네스 설계로 내려왔는지, 그리고 자기진화가 왜 아직 출렁이는지 함께 짚었습니다.
Written by

LLM은 왜 50년 된 알고리즘에마저 지는가, 표 데이터의 숨은 변수
SQL도 짜고 대학원 시험도 통과하는 LLM이 유독 엑셀 표 예측에서는 50년 전 알고리즘에 집니다. 연구진이 5가지 가설을 하나씩 검증한 끝에 찾아낸 진짜 원인은 데이터의 노이즈도, 형식도 아니었습니다.
Written by

MiniMax H3 오픈웨이트 공개, 2K 영상과 스테레오 사운드가 한 번에 나온다
대사와 효과음이 그림과 같은 패스에서 나오는 2K 영상 모델이 오픈웨이트로 풀렸습니다. 전체 정밀도로 123.6GB인 이 모델이 RTX 3060에서 돌아가게 된 건 파라미터 40%를 룩업 테이블로 바꾼 덕이었죠. MiniMax H3가 무엇이고 어디까지 확인됐는지 정리했습니다.
Written by

같은 모델인데 결과가 다르다, DeepSeek V4 Flash가 보여준 추론 강도의 힘
DeepSeek V4 Flash 0731이 지능 대비 비용에서 독보적 위치를 차지했습니다. 그런데 벤치마크 개선의 실체와, 같은 모델도 추론 강도 설정에 따라 결과가 크게 갈린다는 사이먼 윌리슨의 실험을 함께 짚어봅니다.
Written by

AI 추론 과정의 절반을 지워도 답은 그대로 나온다
AI가 답을 내기 전 보여주는 “생각의 사슬” 중 상당수는 실제 답변과 인과관계가 없다는 연구 결과가 나왔습니다. 절반을 지워도 성능이 유지된다는 실험을 통해, AI 추론 과정을 얼마나 믿어야 할지 짚어봅니다.
Written by

AI 에이전트의 기억, 하나가 아니라 다섯 겹으로 나뉜다
왜 어떤 AI 비서는 어제 얘기한 걸 까먹고, 어떤 건 몇 달 전 대화까지 기억할까요. AI 교육자 비노드 추가니가 정리한 에이전트 기억의 5가지 아키텍처 패턴으로, “기억”이라는 한 단어 안에 실은 전혀 다른 다섯 가지 구조가 섞여 있다는 걸 풀어봅니다.
Written by

에이전트 하네스 논쟁, 덜어낼수록 좋아지는 이유
“하네스는 덜어낼수록 좋은가, 그 자체로 가치가 있는가.” AI 업계에서 답이 갈리던 이 질문에 실마리가 나왔습니다. 하네스를 둘로 나눠 보면 두 주장이 동시에 맞을 수 있다는 설명과, 실제로 지시문을 걷어내자 성능은 그대로에 비용만 줄어든 LangChain의 실험 결과를 함께 살펴봅니다.
Written by

AI가 답변에 붙이는 확신도 90%, 사실은 아무 근거가 없다
AI 답변에 붙는 확신도 점수는 왜 근거가 없을까요. 모델이 자기 확신을 정량화할 수 없는 이유와, 실제로는 정확성을 대신 묻는 질문일 뿐이라는 점을 짚어봅니다.
Written by

5분마다 이메일로 지시받는 가짜 에이전트, AgentForger가 보여준 새로운 위협
평범해 보이는 링크 하나를 클릭했을 뿐인데, 회사 안에는 이미 자율 에이전트가 만들어져 있었습니다. 새 동의창도, 이상한 화면도 없었죠. Zenity Labs가 밝힌 ChatGPT Workspace Agents의 허점, AgentForger가 조직의 신뢰 경계를 어떻게 뚫었는지 살펴봅니다.
Written by
