테스트 시나리오
각 시나리오는 Ground Truth(평가 기준)와 여러 테스트 케이스로 구성됩니다.
"이 API가 틀렸나요?"라는 질문은 사실 모호합니다. 기준이 없으면 판단할 수 없거든요.
여기서 Ground Truth가 그 기준 역할을 합니다. "품절 상황에서는 대안 메뉴가 포함되어야 한다"처럼 직접 정의하면, Claude AI가 실제 API 응답과 비교해서 점수를 돌려줍니다.
기준을 바꾸면 같은 응답도 점수가 달라집니다. Ground Truth를 수정하고 같은 케이스를 다시 실행해보면 차이를 바로 확인할 수 있어요.
시나리오가 없습니다. Supabase scenarios 테이블에 데이터를 추가해주세요.