본 연구는 제한된 합성 개구 소나(SAS) 데이터셋으로 인한 수중 표적 인식(ATR)의 어려움을 해결하기 위해 DINOv3 Vision Transformer(ViT)를 활용하는 3단계 파라미터 효율적 프레임워크를 제안합니다. LoRA를 사용하여 사전 학습된 ViT 백본과 수중 음향 특성 간의 간극을 좁히고, 하드 네거티브 마이닝과 지도 학습 기반 대조 학습(SupCon)을 통해 표적과 잡음의 구분을 강화합니다. 연구 결과, LoRA만으로도 AUPRC가 크게 향상되었으며, 추가적인 개선 단계는 큰 효과를 보이지 않아 단일 효율적인 적응 단계만으로도 충분함을 시사합니다.