Sign In
Basic ML/DL

[데이터 전처리] 데이터 전처리

Y
Yerim
카테고리
  1. ML
  2. DataAnalysis

데이터 전처리

데이터 형태: 정형, 반정형, 비정형
데이터 분류: 수치 데이터, 범주형 데이터
컴퓨터가 데이터를 처리할 수 있도록 특정한 형태로 만들어야 한다.
이 과정을 데이터 전처리라고 한다.
대부분의 데이터 사이언티스트가 전처리에 시간을 많이 쏟는다고 응답

데이터 전처리 방법론

1.
Data Cleaning
2.
Data Normalization
3.
Data Transformation
4.
Data Imputation
5.
Data Integration

Data Cleaning

데이터를 정제한다.
잘못 기입된 데이터, 파손된 데이터, 중복된 데이터
→ 데이터를 머신러닝에 집어넣었을 때 에러가 발생할 수 있다.

Data Normalization

데이터의 길이 차를 줄인다.
데이터의 변수 간의 스케일이 심하게 차이가 나는 경우 모든 데이터 포인트가 동일한 정도의 스케일로 반영되도록 해줌
MinMax, Z-Score
Min-Max Normalization
x_{scaled}= \frac {x-x_{min}}{x_{max}-x_{min}}
장점: 모든 feature의 스케일이 [0, 1]로 동일
단점: 이상치를 잘 처리하지 못함
Z-Score Normalization
x_{scaled}=\frac{x-mean}{sd}
단점: 정확히 동일한 척도로 정규화되지는 않음

Data Transformation

가공하여 쓰임새 있게 만든다.
분석이 용이하도록 바꾸는 과정으로 기존 데이터 형태와 분석의 목적에 따라 다양하게 바꿀 수 있다 .
인코딩: Label Encoding, One-Hot Encoding

Data Imputation

비어 있는 값을 처리한다.
결측치 처리 방법 → 삭제, 평균값, 중앙값, 보간법, …

Data Integration

여러 데이터를 통합하여 하나의 의미 있는 데이터를 만든다.
다양한 소스에서 데이터를 처리하기 용이하도록 한 곳에 통합된 방식으로 모으는 방법
Yerim-DevNote
Subscribe to 'Yerim-DevNote'
Subscribe to my site to be the first to receive notifications and emails about the latest updates, including new posts.
Join Slashpage and subscribe to 'Yerim-DevNote'!
Subscribe
👍