AI 에이전트 비용 95% 절감 사례: 프롬프트 캐시 적중률과 서브에이전트 설계의 실제
유니파이 CTO 코너 헤기가 밝힌 에이전트 운영의 실제. 출시 직전 비용을 95% 줄인 방법, 프롬프트 캐시 적중률 95%를 만든 해시 분산 전략, 낭비된 도구 호출을 지표로 삼는 이유, 심판 모델을 다른 회사 모델로 두는 원칙을 정리했다.
핵심 내용 읽기 →AI TOPIC
평가 관련 핵심 뉴스와 활용 인사이트 10편을 최신순으로 모았습니다.

유니파이 CTO 코너 헤기가 밝힌 에이전트 운영의 실제. 출시 직전 비용을 95% 줄인 방법, 프롬프트 캐시 적중률 95%를 만든 해시 분산 전략, 낭비된 도구 호출을 지표로 삼는 이유, 심판 모델을 다른 회사 모델로 두는 원칙을 정리했다.
핵심 내용 읽기 →
AI 엔지니어 콘퍼런스 강연에서 벤 하일랙은 챗봇 시대에 만들어진 평가 방식이 에이전트에는 통하지 않는다고 지적하며, 사용자 신뢰를 무너뜨리는 최악의 동작인 바닥을 찾아내고 관리하는 실전 방법을 정리했다.
핵심 내용 읽기 →
AI 에이전트에 붙이는 스킬이 늘 도움이 되지는 않는다. 약 80개 스킬을 검증한 벤치마크와 성격이 다른 세 가지 과제 실험을 근거로, 스킬이 역효과를 내는 조건과 실무에서 쓸 수 있는 평가 방법을 정리했다.
핵심 내용 읽기 →
범용 챗봇이 아니라 특정 산업을 깊이 파고드는 LLM 제품이 승부처라는 관점에서, 고객 지표 설계와 실패 유형 분류표, 운영 데이터 평가셋, 도메인 전문가 참여로 정확도를 95%에서 99%로 끌어올리는 방법을 정리했다.
핵심 내용 읽기 →
SWE-bench를 만든 존 양이 새 벤치마크 프로그램벤치를 내놨다. 구현 과정 대신 완성된 실행 파일만 평가하는 설계, 출시 당시 0%였던 성적, 인터넷을 열었을 때 드러난 보상 해킹 문제까지 인터뷰에서 짚은 내용을 정리했다.
핵심 내용 읽기 →
구글 클라우드 개발자들이 LLM의 비결정성을 실무에서 다루는 법을 설명한다. 온도를 0으로 내리는 대신, 단계마다 평가를 넣고 도구 호출을 로깅하는 익숙한 소프트웨어 공학 원칙으로 접근하라고 조언한다.
핵심 내용 읽기 →
프롬프트만으로 만든 시제품을 성공하는 AI 제품으로 키우려면 평가 체계가 필요하다. 사람 피드백 수집, 오류 분석, LLM 심판 정렬까지의 실전 과정을 정리했다.
핵심 내용 읽기 →
비결정적인 AI 에이전트의 동작을 어떻게 측정할까. 소프트웨어 테스트에 빗대어 단위·통합·온라인 평가와 벤치마크를 트레이스와 LLM 심판 개념으로 풀어냅니다.
핵심 내용 읽기 →
에이전트를 만드는 것보다 실제로 작동하는지 아는 게 어렵다. 벤치마크와 평가의 차이, 핵심 지표, 골든 데이터셋과 채점 4가지 방법, CI/CD식 평가 루프까지 정리했다.
핵심 내용 읽기 →
Nearform의 테크 리드가 골든 데이터셋과 평가(evals), 코딩 에이전트를 활용해 AI 에이전트의 환각·비결정성 문제를 반복적으로 개선하는 방법과 실제 정확도 향상 사례를 공유한다.
핵심 내용 읽기 →