Sign In

Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding

Author
  • Haebom
Category
Empty

저자

Zihan Zhang, Xize Cheng, Wenhao Yan, Tong Zhang, Dongjie Fu, Boyun Zhang, Yongbo He, Tao Jin

💡 개요

본 논문은 자연어로 설명된 임의의 소리 이벤트를 실시간으로 탐지하는 개방형 어휘 오디오 이벤트 접지(Open-Vocabulary Audio Event Grounding)를 위한 확장 가능한 데이터 구축 파이프라인인 Auto-AEG를 제안합니다. 데이터 부족 문제를 해결하기 위해, Auto-AEG는 정확한 정답 구간을 포함하는 프로그래밍 방식으로 합성된 클립과 실제 오디오의 다중 모델 의사 레이블을 결합하여 지도 학습 및 강화 학습을 위한 데이터를 자동으로 구축합니다. 이 파이프라인을 통한 훈련은 DESED SED 벤치마크와 새로 공개된 AEGBench에서 유망한 성능 향상을 보여주었습니다.

🔑 시사점 및 한계

데이터 구축 자동화: 수작업 비용이 많이 드는 오디오 이벤트의 시작/종료 시간 주석 작업을 자동화하여 대규모 개방형 어휘 오디오 이벤트 접지 데이터셋 구축의 병목 현상을 해결합니다.
LALM의 시간적 지역화 능력 향상: 자동 구축된 데이터와 구간 인식 보상 함수 설계를 통해 대규모 오디오-언어 모델(LALM)의 시간적 지역화 능력을 효과적으로 확장할 수 있음을 입증합니다.
신규 벤치마크 공개: 난이도별로 계층화된 AEGBench를 공개하여 개방형 어휘 오디오 이벤트 접지 연구의 발전을 촉진하고 새로운 모델 성능 평가를 위한 독립적인 기준으로 활용될 수 있습니다.
한계점: 제안된 파이프라인의 성능은 합성된 클립의 품질과 의사 레이블링의 정확성에 영향을 받을 수 있으며, 실제 환경의 복잡성과 다양성을 완전히 반영하지 못할 수 있습니다. 또한, 강화 학습에서의 보상 함수 설계는 여전히 중요한 과제로 남아있습니다.
👍