기존 대규모 언어 모델(LLM) 평가 방법은 생성 과정과 분리되어 모델 개선에 실질적인 피드백을 제공하지 못하는 한계가 있습니다. 본 논문은 평가 자체를 답변 개선을 위한 실행 가능한 제어로 전환하는 CriticGen이라는 세분화된 생성 인식 평가 프레임워크를 제안합니다. CriticGen은 샘플별 평가 차원과 채점 기준을 생성하여, 이를 바탕으로 점수, 이유, 실행 가능한 개선 제안, 그리고 개선된 답변을 공동으로 생성함으로써 모델이 스스로 결함을 진단하고 답변을 개선하도록 돕습니다.