LeanX

평가 세트

평가 세트는 AI 결과의 품질을 반복해서 측정하기 위해 입력과 기대 결과를 짝지어 모아 둔 사례 묶음입니다. 프롬프트나 모델을 바꿔도 같은 기준으로 전후를 비교할 수 있게 해줍니다.

쉽게 말하면

요리 대회 심사위원이 모든 참가자에게 같은 채점표로 점수를 매기는 것과 같아요. 기준 문제지가 고정돼 있어야 어제보다 나아졌는지 알 수 있어요.

예시

지난달 실제 문의 중 대표 사례를 골라 '정답 분류'를 붙여 둠 → 프롬프트를 수정할 때마다 같은 사례로 다시 돌려 분류 정확도와 오류 유형 비교

함께 보면 좋은 용어

AX 파일럿, 할루시네이션, QA

더 배우기

관련 AX 가이드 강의 보기

다음 단계

이 개념을 우리 팀 업무에 어떻게 적용할지 고민된다면 아래에서 시작할 수 있습니다.