# AI@Sogang Audio AI Study

이번 학기에 서강대학교 안에서 AI 를 깊게 공부하고 프로젝트를 할 수 있는 학회를 만들었다. 

설립 멤버로 학회원들의 리크루팅(다른 사람을 평가할 실력은 전혀 아니지만)부터 홍보 행사 기획까지 참여했다.

학회의 첫 공식 활동은 Trocho Study. 네트워킹 자리를 마련해 학회원 들간의 관심 분야를 공유하고, 마음이 맞는 사람들끼리 모여 두달간 스터디를 진행한다.

나는 오디오 AI 분야 스터디에 들어갔다.  선정한 이유는 다음과 같았다.

1. 한 분야의 논문들을 모아보면서 깊게 공부해봐야겠다고 생각했다. 

2. 함께하는 멤버들이 학부연구생들이 많아, 논문을 어떻게 읽는지 배울 수 있을 것 같았다.

3. 작년 K-Startup 챌린지에서 수상한 아이템도 오디오 분야였고, 그 당시 학교의 음성분야를 하시는 교수님도 찾아간 적이 있었다. 서비스에 집중하느라 소홀했던 기술을 더 자세히 알아보고 싶었다.

논문 읽는거 생각보다 어려웠고, 이해하지 못하는 내용이 더 많았다. 수식을 하나하나 이해하려고 노력하다보면 시간을 너무 많이 잡아먹었다. 서베이조차 다 못 읽고 스터디 간 날도 있었고 발표자료 준비를 못한 날도 있었다.

AI를 사용해서 논문 읽기의 난이도를 조금이나마 낮췄다. NotebookLM 으로 논문들을 컨텍스트로 추가하고 먼저 팟캐스트를 만들어 들으면서 쉬운 수준에서 이해했다. 그 다음엔 AI가 생성한 다이어그램과 정리된 문서를 기반으로 방법론들을 구체적으로 확인하고, 문라이트를 이용하여 논문을 읽었다.

---

주차별 서기록을 기반으로 7주간 스터디에서 다루었던 내용들을 정리해보았다.

### 1주차: Audio Representation & Synthesis

오디오 딥러닝의 기초가 되는 데이터 표현 방식과 생성 모델의 원리를 학습했다.

- **Data Representation:** 오디오 데이터는 Raw Audio(Waveform), Spectrogram(STFT, CQT), Acoustic Feature(MFCC, Pitch), Embedding(Wav2Vec) 등 다양한 형태로 표현되며, 목적에 따라 적절한 표현형을 선택해야 한다.

- **Generative Models:** 오디오 생성 모델은 순차적으로 데이터를 생성하는 Auto-regressive 방식(WaveNet)과 비순차적 방식(Diffusion, GAN) 등으로 나뉜다. 최근에는 Normalizing Flow와 Diffusion Model이 활발히 연구되고 있다.

- **Conditioning:** 생성 시 화자 정보(Global)나 음소/텍스트 정보(Local)를 조건으로 부여하여 제어 가능한 음성을 생성하는 기술을 다루었다.

- **주요 논문 및 개념:**

    - **Wav2Vec 2.0:** 라벨 없는 데이터에서 자기 지도 학습(Self-Supervised Learning)을 통해 유의미한 표현을 학습하는 프레임워크.

    - **CQT (Constant-Q Transform):** 음악 신호 분석을 위해 주파수 축을 로그 스케일로 변환하여 저주파의 해상도를 높이는 기법.

    - **Vocoder:** 스펙트로그램과 같은 압축된 표현을 다시 고품질의 Waveform으로 복원하는 신경망의 역할과 중요성.

### 2주차: Audio Restoration & Diffusion Models

오디오 복원(Restoration)을 위한 Diffusion Model의 기초 이론과 응용 사례를 학습했다.

- **Diffusion Model 기초:** 오디오 복원을 확률적 역과정(Reverse Process)을 통한 베이지안 역문제(Inverse Problem)로 정의하고, SDE(Stochastic Differential Equation) 기반의 생성 과정을 다루었다.

- **FlashSR:** 기존 Diffusion 모델의 느린 추론 속도를 개선하기 위해 Teacher LDM의 지식을 Student LDM으로 증류(Distillation)하여 1-step 만에 고해상도 오디오를 생성하는 기술을 리뷰했다.

- **DAVSE:** 오디오뿐만 아니라 입술 움직임(Visual) 정보를 Cross Attention으로 결합하여 잡음 환경에서도 견고한 음성 향상(Speech Enhancement) 모델을 분석했다.

### 3주차: ASR(Automatic Speech Recognition) & Speaker Diarization

음성 인식 모델의 발전 과정과 화자 분할(Diarization) 기술의 핵심 이슈를 학습했다.

- **ASR 기술 동향:** GMM-HMM 기반의 전통적 방식에서 DNN, Transformer, 그리고 최신 Whisper 모델로 이어지는 기술적 흐름을 정리했다.

- **Whisper:** 대규모 약지도 학습(Weak Supervision)을 통해 파인튜닝 없이도 다국어 인식과 번역이 가능한 Robust한 모델 구조와 멀티태스크 토큰 방식을 학습했다.

- **SCST:** ASR의 평가 지표(WER)와 학습 손실 함수(Cross-Entropy) 간의 불일치 문제를 해결하기 위해 강화학습을 도입한 Self-Critical Sequence Training 방법을 리뷰했다.

- **Speaker Diarization:** 화자 분할 시 발생하는 순열 불변(Permutation Invariant) 문제를 해결하기 위한 PIT Loss와 이를 개선한 Optimal Mapping Loss(OPTM) 등을 다루었다.

### 4주차: Source Separation & Evaluation Metrics

음원 분리 기술의 역사와 오디오 AI 모델의 성능 평가 지표를 중점적으로 학습했다.

- **Source Separation 흐름:** ICA, NMF 등 통계적 방식에서 Deep Clustering, PIT, 그리고 Transformer 기반 모델로의 발전 과정을 이해했다.

- **SepFormer:** RNN의 순차적 처리 한계를 극복하기 위해 Transformer와 Dual-Path 방식을 결합하여 SOTA 성능을 달성한 모델 구조를 분석했다.

- **평가 지표 (Metrics):**

    - **음질 평가:** MOS(주관적), PESQ(인지적 품질), STOI(명료도).

    - **분리 성능:** SDR(신호 대 왜곡 비), SIR(간섭 비), SAR(아티팩트 비).

    - **인식 성능:** WER(단어 오류율), CER(문자 오류율).

### 5주차: MIR(Music Information Retrieval) & Multimodal

음악 정보 검색과 멀티모달 오디오 분석, 그리고 SSL 모델의 내부 동작 원리를 학습했다.

- **CLaMP 3:** 텍스트, 악보(Symbolic), 오디오 등 정렬되지 않은 서로 다른 모달리티를 통합 임베딩 공간으로 매핑하여 자연어 기반의 음악 검색을 가능하게 한 모델을 리뷰했다.

- **Music Emotion Prediction:** RNN을 활용하여 오디오 신호로부터 청취자의 감정(Valence, Arousal)을 예측하는 연구와 데이터셋 크기에 따른 모델 성능 차이를 분석했다.

- **Phonological Features in SSL:** SSL 모델이 레이블 없이도 하위 레이어에서는 음향 특징을, 상위 레이어에서는 언어학적(음운) 특징을 스스로 학습한다는 'Probing' 분석 결과를 학습했다.

### 6~7주차: SED(Sound Event Detection) & SELD

소리 이벤트 탐지(SED)와 위치 추정(DOA)을 결합한 SELD 기술 및 최신 아키텍처를 심도 있게 학습했다.

- **SELD 개요:** 소리의 종류(What)를 파악하는 SED와 발생 위치(Where)를 파악하는 DOA를 동시에 수행하는 기술이다. 다성(Polyphonic) 환경과 데이터 부족이 주요 난제이다.

- **특징 추출 (Feature Extraction):**

    - **시간/주파수:** Mel-Spectrogram, MFCC 등.

    - **공간 정보:** ITD(양이 시간 차), ILD(양이 레벨 차), Spectral Cues(핀나 단서) 등을 결합하여 8채널 이상의 입력을 구성하기도 한다.

- **모델 아키텍처:**

    - **CRNN:** CNN으로 특징을 추출하고 RNN으로 시간적 흐름을 모델링하는 SOTA급 구조.

    - **Mamba (SSM):** Transformer의 연산량(이차 복잡도) 문제를 해결하기 위해 선형적 복잡도를 가진 State Space Model 기반의 Mamba를 SELD에 적용, 효율성과 성능을 개선했다.

- **평가 지표:** 이벤트 탐지의 정확도를 보는 F-score, Error rate와 위치 추정의 정확도를 보는 DOA Error 등을 종합적으로 활용한다.

---

주차가 쌓여갈 수록 조금씩 일반적인 관점(물론 잘못된 관점일 수도 있음)이 생겼다.

1. 모든 논문에서 전통적인 방법론을 소개하고, 딥러닝 기반의 end 2 end 방식이 SOTA 가 되었더라 라는 패턴이 자주 보였다. 

2. 아직도 데이터셋과 강인성 문제는 해결과제로 남는다.

3. input 으로 데이터를 어떤 형태로 사용할 것인지가 생각보다 다양하지만, 매주 보던 애들(MFCC, raw, Mel-Spectro)은 매번 나오더라.

4. 하나의 모델/방법론이 모든 어플리케이션에서 좋기 어렵다.  트레이드오프와 장단점이 있다.

5. metric 도 다양하고, 사람들이 친절하게 공개해둔 벤치마크 데이터셋이 많다.

![Image](https://upload.cafenono.com/image/slashpagePost/20251127/012153_yG2QldPDL2BSku4Rvb?q=80&s=1280x180&t=outside&f=webp)

![Image](https://upload.cafenono.com/image/slashpagePost/20251127/005929_R37dIo3aQh6qSRPJyl?q=80&s=1280x180&t=outside&f=webp)

![Image](https://upload.cafenono.com/image/slashpagePost/20251127/005929_F06JiqapMgrYTyMMN0?q=80&s=1280x180&t=outside&f=webp)

![Image](https://upload.cafenono.com/image/slashpagePost/20251127/005929_ZsuOj1DgLsDctp96Dt?q=80&s=1280x180&t=outside&f=webp)

![Image](https://upload.cafenono.com/image/slashpagePost/20251127/005929_vltlCJmtitAWrizaHF?q=80&s=1280x180&t=outside&f=webp)

For the site tree, see the [root Markdown](https://slashpage.com/yejun-cheon.md).
