본 연구는 비일관적인 언어, 음향, 얼굴, 맥락 패턴으로 인해 어려운 양가성 및 망설임의 자동 인식을 위해 텍스트 중심의 단일 멀티모달 접근 방식을 제안합니다. 제안된 Text Residual Fusion 모델은 텍스트를 주요 모달리티로 삼고 다른 모달리티의 정보를 게이트 잔차 조정을 통해 통합하여 성능을 향상시킵니다. 실험 결과, 이 모델은 BAH 코퍼스에서 상당한 수준의 양가성 및 망설임 인식 성능을 달성하며, 앙상블 모델 없이도 멀티모달 정보의 효과를 입증했습니다.