잘못 기입된 데이터, 파손된 데이터, 중복된 데이터 → 데이터를 머신러닝에 집어넣었을 때 에러가 발생할 수 있다.
Data Normalization
•
데이터의 길이 차를 줄인다.
•
데이터의 변수 간의 스케일이 심하게 차이가 나는 경우 모든 데이터 포인트가 동일한 정도의 스케일로 반영되도록 해줌
•
MinMax, Z-Score
Min-Max Normalization
x_{scaled}= \frac {x-x_{min}}{x_{max}-x_{min}}
•
장점: 모든 feature의 스케일이 [0, 1]로 동일
•
단점: 이상치를 잘 처리하지 못함
Z-Score Normalization
x_{scaled}=\frac{x-mean}{sd}
•
단점: 정확히 동일한 척도로 정규화되지는 않음
Data Transformation
•
가공하여 쓰임새 있게 만든다.
•
분석이 용이하도록 바꾸는 과정으로 기존 데이터 형태와 분석의 목적에 따라 다양하게 바꿀 수 있다 .
•
인코딩: Label Encoding, One-Hot Encoding
Data Imputation
•
비어 있는 값을 처리한다.
•
결측치 처리 방법 → 삭제, 평균값, 중앙값, 보간법, …
Data Integration
•
여러 데이터를 통합하여 하나의 의미 있는 데이터를 만든다.
•
다양한 소스에서 데이터를 처리하기 용이하도록 한 곳에 통합된 방식으로 모으는 방법
Subscribe to 'Yerim-DevNote'
Subscribe to my site to be the first to receive notifications and emails about the latest updates, including new posts.
Join Slashpage and subscribe to 'Yerim-DevNote'!