Sign In

Scale Weight Decay and Train Better

작성자
Haebom
카테고리
Empty

저자

Anuj Apte

💡 개요

기존 신경망 학습에서 사용되는 불변의 가중치 감쇠(weight decay)는 학습 과정에서 가중치를 지속적으로 감소시켜 비최적화 편향을 유발합니다. 본 연구는 Robbins-Monro 조건에 착안하여 학습률의 최댓값 대비 현재 학습률 비율로 가중치 감쇠를 조절하는 방법을 제안합니다. 이 스케일링된 가중치 감쇠는 상수 가중치 감쇠로 인해 발생하는 점근적 편향을 피하면서도 가중치 감쇠의 안정성 이점을 유지합니다.

🔑 시사점 및 한계

스케일링된 가중치 감쇠는 학습률에 따라 조절되어, 상수 가중치 감쇠와 달리 점근적 최적화 목표를 유지하면서도 안정적인 학습을 보장합니다.
Mixture-of-Experts 모델 학습에서 제안된 방법(Muon-SW)은 동일 하이퍼파라미터 하에서 기존 방법 대비 약 30% 더 빠르게 동일한 검증 손실에 도달하는 성능 향상을 보여주었습니다.
제안된 방법은 구현이 간편하여 대규모 모델의 사전 학습 속도를 크게 높일 수 있는 잠재력을 가집니다.
실험 규모와 모델 크기에 따른 효과의 일반화 가능성 및 다른 유형의 모델이나 정규화 기법과의 상호작용에 대한 추가 연구가 필요합니다.
👍