본 논문은 교육용 LLM이 직접적인 답변 제공 대신 소크라테스식 교육의 원칙에 따라 학생을 점진적 탐구로 안내하도록 조정하는 새로운 방법론인 HeuristicEdu를 제안합니다. 797개의 중국어 어린이 과학 대화 데이터셋을 활용하여 인지적 깊이, 호기심 유도, 직접성 등을 고려한 휴리스틱 보상과 함께 지도 학습 및 그룹 상대 정책 최적화(GRPO)를 통해 LLM을 훈련합니다. 이를 통해 기존의 직접 답변 방식 LLM에 비해 소크라테스식 교육 효과와 대화 깊이를 크게 향상시키는 성과를 거두었습니다.