# [데이터 전처리] 데이터 전처리

## 데이터 전처리

---

> 데이터 형태: 정형, 반정형, 비정형
> 데이터 분류: 수치 데이터, 범주형 데이터

![Image](https://upload.cafenono.com/image/slashpagePost/20250201/172916_shV5NbZ7D5S3UBq4qb?q=80&s=1280x180&t=outside&f=webp)

- 컴퓨터가 데이터를 처리할 수 있도록 특정한 형태로 만들어야 한다.

- 이 과정을 데이터 전처리라고 한다.

- 대부분의 데이터 사이언티스트가 전처리에 시간을 많이 쏟는다고 응답

### 데이터 전처리 방법론

---

![Image](https://upload.cafenono.com/image/slashpagePost/20250201/172932_0MgUH2NyQuldNoc2CJ?q=80&s=1280x180&t=outside&f=webp)

1. **Data Cleaning**

2. **Data Normalization**

3. **Data Transformation**

4. **Data Imputation**

5. **Data Integration**

### Data Cleaning

- 데이터를 정제한다.

- 잘못 기입된 데이터, 파손된 데이터, 중복된 데이터
- → 데이터를 머신러닝에 집어넣었을 때 에러가 발생할 수 있다.

### Data Normalization

- 데이터의 길이 차를 줄인다.

- 데이터의 변수 간의 스케일이 심하게 차이가 나는 경우 모든 데이터 포인트가 동일한 정도의 스케일로 반영되도록 해줌

- MinMax, Z-Score

**Min-Max Normalization**

x_{scaled}= \frac {x-x_{min}}{x_{max}-x_{min}}

- 장점: 모든 feature의 스케일이 [0, 1]로 동일

- 단점: 이상치를 잘 처리하지 못함

**Z-Score Normalization**

x_{scaled}=\frac{x-mean}{sd}

- 단점: 정확히 동일한 척도로 정규화되지는 않음

### Data Transformation

- 가공하여 쓰임새 있게 만든다.

- 분석이 용이하도록 바꾸는 과정으로 기존 데이터 형태와 분석의 목적에 따라 다양하게 바꿀 수 있다 .

- 인코딩: Label Encoding, One-Hot Encoding

### Data Imputation

- 비어 있는 값을 처리한다.

- 결측치 처리 방법 → 삭제, 평균값, 중앙값, 보간법, …

### Data Integration

- 여러 데이터를 통합하여 하나의 의미 있는 데이터를 만든다.

- 다양한 소스에서 데이터를 처리하기 용이하도록 한 곳에 통합된 방식으로 모으는 방법

For the site tree, see the [root Markdown](https://slashpage.com/yerim-devnote.md).
