이번 학기에 서강대학교 안에서 AI 를 깊게 공부하고 프로젝트를 할 수 있는 학회를 만들었다.
설립 멤버로 학회원들의 리크루팅(다른 사람을 평가할 실력은 전혀 아니지만)부터 홍보 행사 기획까지 참여했다.
학회의 첫 공식 활동은 Trocho Study. 네트워킹 자리를 마련해 학회원 들간의 관심 분야를 공유하고, 마음이 맞는 사람들끼리 모여 두달간 스터디를 진행한다.
나는 오디오 AI 분야 스터디에 들어갔다. 선정한 이유는 다음과 같았다.
1.
한 분야의 논문들을 모아보면서 깊게 공부해봐야겠다고 생각했다.
2.
함께하는 멤버들이 학부연구생들이 많아, 논문을 어떻게 읽는지 배울 수 있을 것 같았다.
3.
작년 K-Startup 챌린지에서 수상한 아이템도 오디오 분야였고, 그 당시 학교의 음성분야를 하시는 교수님도 찾아간 적이 있었다. 서비스에 집중하느라 소홀했던 기술을 더 자세히 알아보고 싶었다.
논문 읽는거 생각보다 어려웠고, 이해하지 못하는 내용이 더 많았다. 수식을 하나하나 이해하려고 노력하다보면 시간을 너무 많이 잡아먹었다. 서베이조차 다 못 읽고 스터디 간 날도 있었고 발표자료 준비를 못한 날도 있었다.
AI를 사용해서 논문 읽기의 난이도를 조금이나마 낮췄다. NotebookLM 으로 논문들을 컨텍스트로 추가하고 먼저 팟캐스트를 만들어 들으면서 쉬운 수준에서 이해했다. 그 다음엔 AI가 생성한 다이어그램과 정리된 문서를 기반으로 방법론들을 구체적으로 확인하고, 문라이트를 이용하여 논문을 읽었다.
주차별 서기록을 기반으로 7주간 스터디에서 다루었던 내용들을 정리해보았다.
1주차: Audio Representation & Synthesis
오디오 딥러닝의 기초가 되는 데이터 표현 방식과 생성 모델의 원리를 학습했다.
•
Data Representation: 오디오 데이터는 Raw Audio(Waveform), Spectrogram(STFT, CQT), Acoustic Feature(MFCC, Pitch), Embedding(Wav2Vec) 등 다양한 형태로 표현되며, 목적에 따라 적절한 표현형을 선택해야 한다.
•
Generative Models: 오디오 생성 모델은 순차적으로 데이터를 생성하는 Auto-regressive 방식(WaveNet)과 비순차적 방식(Diffusion, GAN) 등으로 나뉜다. 최근에는 Normalizing Flow와 Diffusion Model이 활발히 연구되고 있다.
•
Conditioning: 생성 시 화자 정보(Global)나 음소/텍스트 정보(Local)를 조건으로 부여하여 제어 가능한 음성을 생성하는 기술을 다루었다.
•
주요 논문 및 개념:
◦
Wav2Vec 2.0: 라벨 없는 데이터에서 자기 지도 학습(Self-Supervised Learning)을 통해 유의미한 표현을 학습하는 프레임워크.
◦
CQT (Constant-Q Transform): 음악 신호 분석을 위해 주파수 축을 로그 스케일로 변환하여 저주파의 해상도를 높이는 기법.
◦
Vocoder: 스펙트로그램과 같은 압축된 표현을 다시 고품질의 Waveform으로 복원하는 신경망의 역할과 중요성.
2주차: Audio Restoration & Diffusion Models
오디오 복원(Restoration)을 위한 Diffusion Model의 기초 이론과 응용 사례를 학습했다.
•
Diffusion Model 기초: 오디오 복원을 확률적 역과정(Reverse Process)을 통한 베이지안 역문제(Inverse Problem)로 정의하고, SDE(Stochastic Differential Equation) 기반의 생성 과정을 다루었다.
•
FlashSR: 기존 Diffusion 모델의 느린 추론 속도를 개선하기 위해 Teacher LDM의 지식을 Student LDM으로 증류(Distillation)하여 1-step 만에 고해상도 오디오를 생성하는 기술을 리뷰했다.
•
DAVSE: 오디오뿐만 아니라 입술 움직임(Visual) 정보를 Cross Attention으로 결합하여 잡음 환경에서도 견고한 음성 향상(Speech Enhancement) 모델을 분석했다.
음성 인식 모델의 발전 과정과 화자 분할(Diarization) 기술의 핵심 이슈를 학습했다.
•
ASR 기술 동향: GMM-HMM 기반의 전통적 방식에서 DNN, Transformer, 그리고 최신 Whisper 모델로 이어지는 기술적 흐름을 정리했다.
•
Whisper: 대규모 약지도 학습(Weak Supervision)을 통해 파인튜닝 없이도 다국어 인식과 번역이 가능한 Robust한 모델 구조와 멀티태스크 토큰 방식을 학습했다.
•
SCST: ASR의 평가 지표(WER)와 학습 손실 함수(Cross-Entropy) 간의 불일치 문제를 해결하기 위해 강화학습을 도입한 Self-Critical Sequence Training 방법을 리뷰했다.
•
Speaker Diarization: 화자 분할 시 발생하는 순열 불변(Permutation Invariant) 문제를 해결하기 위한 PIT Loss와 이를 개선한 Optimal Mapping Loss(OPTM) 등을 다루었다.
4주차: Source Separation & Evaluation Metrics
음원 분리 기술의 역사와 오디오 AI 모델의 성능 평가 지표를 중점적으로 학습했다.
•
Source Separation 흐름: ICA, NMF 등 통계적 방식에서 Deep Clustering, PIT, 그리고 Transformer 기반 모델로의 발전 과정을 이해했다.
•
SepFormer: RNN의 순차적 처리 한계를 극복하기 위해 Transformer와 Dual-Path 방식을 결합하여 SOTA 성능을 달성한 모델 구조를 분석했다.
•
평가 지표 (Metrics):
◦
음질 평가: MOS(주관적), PESQ(인지적 품질), STOI(명료도).
◦
분리 성능: SDR(신호 대 왜곡 비), SIR(간섭 비), SAR(아티팩트 비).
◦
인식 성능: WER(단어 오류율), CER(문자 오류율).
5주차: MIR(Music Information Retrieval) & Multimodal
음악 정보 검색과 멀티모달 오디오 분석, 그리고 SSL 모델의 내부 동작 원리를 학습했다.
•
CLaMP 3: 텍스트, 악보(Symbolic), 오디오 등 정렬되지 않은 서로 다른 모달리티를 통합 임베딩 공간으로 매핑하여 자연어 기반의 음악 검색을 가능하게 한 모델을 리뷰했다.
•
Music Emotion Prediction: RNN을 활용하여 오디오 신호로부터 청취자의 감정(Valence, Arousal)을 예측하는 연구와 데이터셋 크기에 따른 모델 성능 차이를 분석했다.
•
Phonological Features in SSL: SSL 모델이 레이블 없이도 하위 레이어에서는 음향 특징을, 상위 레이어에서는 언어학적(음운) 특징을 스스로 학습한다는 'Probing' 분석 결과를 학습했다.
6~7주차: SED(Sound Event Detection) & SELD
소리 이벤트 탐지(SED)와 위치 추정(DOA)을 결합한 SELD 기술 및 최신 아키텍처를 심도 있게 학습했다.
•
SELD 개요: 소리의 종류(What)를 파악하는 SED와 발생 위치(Where)를 파악하는 DOA를 동시에 수행하는 기술이다. 다성(Polyphonic) 환경과 데이터 부족이 주요 난제이다.
•
특징 추출 (Feature Extraction):
◦
시간/주파수: Mel-Spectrogram, MFCC 등.
◦
공간 정보: ITD(양이 시간 차), ILD(양이 레벨 차), Spectral Cues(핀나 단서) 등을 결합하여 8채널 이상의 입력을 구성하기도 한다.
•
모델 아키텍처:
◦
CRNN: CNN으로 특징을 추출하고 RNN으로 시간적 흐름을 모델링하는 SOTA급 구조.
◦
Mamba (SSM): Transformer의 연산량(이차 복잡도) 문제를 해결하기 위해 선형적 복잡도를 가진 State Space Model 기반의 Mamba를 SELD에 적용, 효율성과 성능을 개선했다.
•
평가 지표: 이벤트 탐지의 정확도를 보는 F-score, Error rate와 위치 추정의 정확도를 보는 DOA Error 등을 종합적으로 활용한다.
주차가 쌓여갈 수록 조금씩 일반적인 관점(물론 잘못된 관점일 수도 있음)이 생겼다.
1.
모든 논문에서 전통적인 방법론을 소개하고, 딥러닝 기반의 end 2 end 방식이 SOTA 가 되었더라 라는 패턴이 자주 보였다.
2.
아직도 데이터셋과 강인성 문제는 해결과제로 남는다.
3.
input 으로 데이터를 어떤 형태로 사용할 것인지가 생각보다 다양하지만, 매주 보던 애들(MFCC, raw, Mel-Spectro)은 매번 나오더라.
4.
하나의 모델/방법론이 모든 어플리케이션에서 좋기 어렵다. 트레이드오프와 장단점이 있다.
5.
metric 도 다양하고, 사람들이 친절하게 공개해둔 벤치마크 데이터셋이 많다.
'Yejun Cheon' की सदस्यता लें
साइट को सब्सक्राइब करने पर आप नए पोस्ट आदि के नवीनतम अपडेट सबसे पहले नोटिफिकेशन और ईमेल से प्राप्त कर सकते हैं.
Slashpage में शामिल हों और 'Yejun Cheon' को सब्सक्राइब करें!