검색에이전트
BrowseComp 1위 모델이 진짜 검색엔 꼴찌, AI 벤치마크의 치명적 맹점
AI 검색 에이전트가 실제로는 검색 없이 학습 기억에 의존해 BrowseComp 점수를 올린다는 연구. 기억을 차단한 LiveBrowseComp에서 순위가 완전히 뒤집히는 실험 결과를 소개합니다.
Written by

AI 에이전트가 검색을 건너뛰는 순간, Google·NYU 연구가 발견한 4가지 패턴
Google·NYU 연구팀이 AI 딥서치 에이전트를 훈련하다 발견한 4가지 패턴. 에이전트가 다단계 탐색을 건너뛰는 조건을 처음 정량화한 SAGE 논문을 소개합니다.
Written by
