출력이 실제로 좋은지 측정한다 — 충실도·관련성·정확성을 지표와 테스트 스위트로, CI에서 실행하도록.
조건에 맞는 도구가 없습니다.
Confident AI
LLM용 Pytest 같은 오픈소스 — 모델·RAG 출력을 지표로 유닛 테스트
Exploding Gradients
RAG 파이프라인과 LLM 애플리케이션을 위한 오픈소스 평가 프레임워크