타우 벤치 논문 리뷰: 대화형 AI 에이전트 평가에서 일관성과 지시 수행이 갈리는 지점
서울대 DSBA 연구실이 타우 벤치와 후속 연구를 리뷰하며 멀티턴 상호작용과 정책 준수, 반복 일관성을 함께 재야 하는 이유를 정리하고, 사용자와 협업할 때 오히려 점수가 떨어지는 평가 결과를 짚었다.
핵심 내용 읽기 →AI TOPIC
평가지표 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

서울대 DSBA 연구실이 타우 벤치와 후속 연구를 리뷰하며 멀티턴 상호작용과 정책 준수, 반복 일관성을 함께 재야 하는 이유를 정리하고, 사용자와 협업할 때 오히려 점수가 떨어지는 평가 결과를 짚었다.
핵심 내용 읽기 →
모델을 학습시키는 것만으로는 부족하다. 실제 성능을 알려면 평가 지표가 필요하다. 분류에 쓰는 정확도·정밀도·재현율·F1부터 회귀의 MAE·RMSE·R²까지 언제 무엇을 쓸지 정리한다.
핵심 내용 읽기 →