지금은 LangSmith에서 자체적으로 커스텀 검증 프로젝트를 운영하며, 샘플 요청에 대해 어시스턴트 답변을 생성한 뒤, 심사 LLM이 해당 답변을 평가해 점수를 매기는 방식을 취하고 있습니다. 이렇게 하면 다른 프롬프트나 모델을 실험할 때, 여러 테스트 케이스에 대해 더 빠르게 품질을 확인할 수 있죠. 물론 제대로 된 평가 프레임워크를 만들기까지 많은 시행착오가 있었고, 지금도 새로운 변경사항이 생길 때마다 항상 재시험을 거쳐야 합니다. 현재는 거의 50개 정도의 시나리오를 가지고, 변경할 때마다 이 프레임워크로 확인해봅니다.