에이전트 eval 함수 해부 글 짚어보기 (1) — eval의 구조와 용어 사전
AI 에이전트 평가의 기본 구조와 핵심 용어(task, trial, grader, transcript, outcome 등)를 원문을 따라 정리한다.
2026년 4월 14일
5개의 글이 있습니다.
AI 에이전트 평가의 기본 구조와 핵심 용어(task, trial, grader, transcript, outcome 등)를 원문을 따라 정리한다.
수동 테스트의 한계부터 eval-driven development까지, eval이 에이전트 개발에 가져다주는 가치를 원문을 따라 해설한다.
code-based, model-based, human 세 가지 grader 유형과 코딩/대화형/리서치/컴퓨터 사용 에이전트별 eval 전략을 원문을 따라 해설한다.
에이전트 eval 결과가 매번 다른 이유와 이를 다루는 두 가지 핵심 메트릭 pass@k, pass^k를 원문을 따라 해설한다.
eval이 없는 상태에서 신뢰할 수 있는 eval 시스템을 구축하기까지의 8단계 로드맵과 Swiss Cheese Model을 원문을 따라 해설한다.