컴퓨터 사용 AI 에이전트 벤치마크의 허점: 리플레이 스크립트와 pass@k가 드러낸 평가 함정
AI 엔지니어 컨퍼런스 발표에서 연구자가 화면을 보지 않고 녹화된 동작만 되풀이하는 1MB 스크립트로 최신 모델을 앞섰다. 컴퓨터 사용 에이전트 벤치마크의 결정론성과 과신된 신뢰구간이 만드는 구조적 문제, 그리고 그 해법을 짚는다.
핵심 내용 읽기 →AI TOPIC
컴퓨터 사용 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

AI 엔지니어 컨퍼런스 발표에서 연구자가 화면을 보지 않고 녹화된 동작만 되풀이하는 1MB 스크립트로 최신 모델을 앞섰다. 컴퓨터 사용 에이전트 벤치마크의 결정론성과 과신된 신뢰구간이 만드는 구조적 문제, 그리고 그 해법을 짚는다.
핵심 내용 읽기 →
언어 모델에 웹 브라우저와 데스크톱 전체를 통째로 맡기는 컴퓨터 사용 에이전트의 최근 흐름을 정리했다. 함수 호출의 한계, DOM 방식과 스크린샷 방식의 차이를 오픈소스와 상용 에이전트 사례로 나란히 짚는다.
핵심 내용 읽기 →
AI 엔지니어 컨퍼런스 강연에서 아마존 AGI 랩의 안체 바르트가 클릭을 넘어 ‘신뢰성’이 관건이라며, 화면을 사람처럼 인식하고 자기 작업을 검증하는 ‘퍼셉션 에이전트’ 개념과 오픈소스 도구를 소개했다.
핵심 내용 읽기 →