에이전트 eval 함수 해부 글 짚어보기 (1) — eval의 구조와 용어 사전
AI 에이전트 평가의 기본 구조와 핵심 용어(task, trial, grader, transcript, outcome 등)를 원문을 따라 정리한다.
2026년 4월 14일
8개의 글이 있습니다.
AI 에이전트 평가의 기본 구조와 핵심 용어(task, trial, grader, transcript, outcome 등)를 원문을 따라 정리한다.
수동 테스트의 한계부터 eval-driven development까지, eval이 에이전트 개발에 가져다주는 가치를 원문을 따라 해설한다.
code-based, model-based, human 세 가지 grader 유형과 코딩/대화형/리서치/컴퓨터 사용 에이전트별 eval 전략을 원문을 따라 해설한다.
에이전트 eval 결과가 매번 다른 이유와 이를 다루는 두 가지 핵심 메트릭 pass@k, pass^k를 원문을 따라 해설한다.
eval이 없는 상태에서 신뢰할 수 있는 eval 시스템을 구축하기까지의 8단계 로드맵과 Swiss Cheese Model을 원문을 따라 해설한다.
서브에이전트를 병렬로 실행하고 결과를 취합하는 패턴 실습.
PM-엔지니어-QA 세 에이전트가 협업하는 오케스트레이터 워크플로우 실습.
메인에이전트와 서브에이전트간의 통신 살펴보기