LeanX
평가 세트
평가 세트는 AI 결과의 품질을 반복해서 측정하기 위해 입력과 기대 결과를 짝지어 모아 둔 사례 묶음입니다. 프롬프트나 모델을 바꿔도 같은 기준으로 전후를 비교할 수 있게 해줍니다.
쉽게 말하면
요리 대회 심사위원이 모든 참가자에게 같은 채점표로 점수를 매기는 것과 같아요. 기준 문제지가 고정돼 있어야 어제보다 나아졌는지 알 수 있어요.
예시
지난달 실제 문의 중 대표 사례를 골라 '정답 분류'를 붙여 둠 → 프롬프트를 수정할 때마다 같은 사례로 다시 돌려 분류 정확도와 오류 유형 비교
함께 보면 좋은 용어
AX 파일럿, 할루시네이션, QA
더 배우기
관련 AX 가이드 강의 보기
다음 단계
이 개념을 우리 팀 업무에 어떻게 적용할지 고민된다면 아래에서 시작할 수 있습니다.