AI가 답변에 붙이는 확신도 90%, 사실은 아무 근거가 없다
AI 답변에 붙는 확신도 점수는 왜 근거가 없을까요. 모델이 자기 확신을 정량화할 수 없는 이유와, 실제로는 정확성을 대신 묻는 질문일 뿐이라는 점을 짚어봅니다.
Written by
스킬 600개 쌓인 에이전트, 문제는 개수가 아니라 설명 충돌이었다
에이전트 스킬은 개수보다 설명 충돌이 문제입니다. 두 스킬의 설명이 겹치면 라우터가 엉뚱한 걸 부르는 이유와, 실제 개발자들이 이 문제를 어떻게 점검하는지 다섯 가지 사례로 살펴봅니다.
Written by
5분 만에 세팅한 오픈모델, 내 엔드포인트를 갖는 게 이렇게 좋을 줄 몰랐다
클로드·챗GPT만 쓰던 개발자가 오픈모델 엔드포인트를 5분 만에 세팅해보고 느낀 뜻밖의 해방감. 오픈웨이트 모델의 매력이 성능이 아니라 소유감일 수 있다는 개인 경험담을 소개합니다.
Written by
2.8조 파라미터 Kimi K3, 맥북 한 대로 돌리면 토큰 하나에 16초 걸린다
2.8조 파라미터 Kimi K3를 맥북 한 대에서 돌리는 개인 프로젝트 Deltafin. MoE 모델의 희소성 원리로 램 부족을 우회하는 방법과, 속도 대신 정확성·재현성을 택한 이유를 살펴봅니다.
Written by
2.8조 파라미터 Kimi K3 가중치 공개, ‘오픈소스’라 부르지 않는 이유
문샷AI가 2.8조 파라미터 Kimi K3의 가중치를 정식 공개했습니다. 최대 규모 오픈웨이트 모델인데, 정작 회사는 스스로 “오픈소스”라 부르지 않습니다. 효율화 아키텍처와 강화된 라이선스 조건을 함께 짚어봅니다.
Written by
고객경험 담당자 77%가 남의 일을 하고 있다, ChatGPT가 드러낸 직무 경계
OpenAI가 ChatGPT 업무 메시지 80만 건을 분석해보니 43.5%가 이용자 본인 직군이 아닌 다른 직군 업무였습니다. 고객경험 담당자 77%, 디자이너 75%가 원래 남의 일을 AI로 처리하고 있는데, 이 데이터가 직무 경계의 변화를 어떻게 보여주는지 짚어봤습니다.
Written by
가운 입고 졸업장 건 AI 의사, 페이스북에서 보충제를 팔고 있었다
페이스북과 인스타그램에서 AI로 만든 가짜 의사가 검증 안 된 보충제를 팔고 있습니다. 뉴욕타임스가 수백 개 광고를 조사해보니 졸업장, 국기, 사무실까지 신뢰를 꾸며내는 공식이 있었고, 실제 리콜 사태로 이어진 사례도 있었습니다.
Written by
링크만 아는 사람만 본다던 Claude 공유 대화, 구글 검색에 그대로 떴다
링크를 아는 사람만 볼 수 있다고 믿었던 Claude 공유 대화와 아티팩트가 구글 검색 한 번으로 노출됐습니다. 암호화폐 키, 법률 상담까지 걸린 이번 사건이 “공유”의 의미를 다시 생각하게 만듭니다.
Written by
로봇에게 동작만이 아니라 생각까지 가르친다, 뇌파로 훈련 데이터를 만드는 스타트업
로봇 학습 데이터 회사 Encord가 사람 뇌파까지 훈련 데이터로 태깅하는 실험을 하고 있습니다. 챗봇은 인터넷 텍스트를 공짜로 긁어왔지만 로봇은 물리 데이터를 직접 “제조”해야 하는 처지인데, 그 병목이 지금 어디까지 와 있는지 보여줍니다.
Written by
플래너는 계획만, 워커는 실행만, Cursor 에이전트 스웜이 찾은 답
Cursor가 플래너·워커로 역할을 나눈 에이전트 스웜으로 SQLite를 문서만 보고 재구현시켰습니다. 커밋 속도는 1,000배, 머지 충돌은 70분의 1로 줄었는데, 비슷한 “비싼 모델+저렴한 모델” 조합이 최근 다른 실험에선 오히려 손해였던 이유와 비교해보면 흥미롭습니다.
Written by









