Sign In

Soft-TransFormers for Continual Learning

Author
  • Haebom
Category
Empty

저자

Haeyong Kang, Chang D. Yoo

💡 개요

본 연구는 사전 학습된 트랜스포머 모델을 동결한 상태로 지속 학습하는 Soft-TransFormers (Soft-TF) 프레임워크를 제안합니다. 이는 각 태스크별로 특정 셀프 어텐션 레이어의 쿼리, 키, 값, 출력 프로젝션에 실수값 곱셈 마스크를 적용하여 모델을 적응시키는 방식입니다. 제안된 방법론은 망각을 구조적으로 제거하고, 태스크 추론 오류의 영향을 최소화하며, 다양한 벤치마크에서 기존 방법론 대비 우수한 성능을 보여줍니다.

🔑 시사점 및 한계

구조적 망각 제거: 백본 모델과 태스크별 마스크가 덮어쓰이지 않기 때문에 지속 학습 과정에서 발생하는 망각 문제를 근본적으로 해결합니다.
태스크 추론 오류 완화: 각 태스크의 서브네트워크가 공유 사전 학습 솔루션에 가깝게 유지되므로, 잘못된 태스크 추론이 발생하더라도 일반화 성능이 크게 저하되지 않습니다.
기존 방법론과의 효과적인 결합 및 효율성: L2P, DualPrompt 등 기존 프롬프트 기반 방법론과 효과적으로 결합될 수 있으며, 동등한 학습 가능 파라미터 예산으로도 더 나은 성능을 제공하고 추론 비용은 원본 백본과 동일합니다.
👍