투명한 물체를 조작할 때 발생하는 자기 가림, 심각한 깊이 잡음, 깊이 정보 손실 문제를 해결하기 위해, 본 논문은 점군 재구성 사전 학습을 기반으로 하는 3D 시각-촉각 융합 모터 정책인 TransDex를 제안합니다. 제안된 Transformer 기반 자기 지도 학습 점군 재구성 방법은 임의 노이즈와 대규모 마스킹 하에서도 손의 대화형 점군으로부터 물체의 3D 구조를 정확하게 복원합니다. 이를 바탕으로 TransDex는 세분화된 계층적 체계와 다중 라운드 주의 메커니즘을 채택하여 로봇 팔과 섬세한 손의 특징을 적응적으로 융합함으로써 차별화된 동작 예측을 가능하게 합니다.