AI가 제대로 동작하는지 검증하는 오픈소스 LLM 평가·테스트 도구 모음
DeepEval, Promptfoo, Ragas, Opik, Arize Phoenix 등 LLM과 AI 에이전트의 환각 검증, RAG 검색 품질 측정, 실행 추적과 관측성 확보를 돕는 핵심 오픈소스 도구들을 정리했습니다.
TAU HOME에서 LLMEval 태그로 묶인 글입니다.
DeepEval, Promptfoo, Ragas, Opik, Arize Phoenix 등 LLM과 AI 에이전트의 환각 검증, RAG 검색 품질 측정, 실행 추적과 관측성 확보를 돕는 핵심 오픈소스 도구들을 정리했습니다.