[데이터 분석] EDA
Y
Yerim
- DataAnalysis
시각화 | 비시각화 | |
일변량 | 일변량 시각화 | 일변량 비시각화 |
다변량 | 다변량 시각화 | 다변량 비시각화 |
Python type | 데이터 형태 | 카카오톡 데이터 예시 | |
object | str or mixed | 텍스트(문자열) 혹은 복합구성 | - 텍스트 메시지 (text) |
int64 | int | 정수 (integer numbers) | - 메시지 길이(msg_len) - 메시지 단어 수(msg_word_count) |
float64 | float | 실수 | |
bool | bool | 참/거짓 값(True/False) | |
datetime64 | - | 날짜와 시간 | - 메시지 보낸 날짜 (date_time) |
timedelta[ns] | - | 두 시각의 차이 | |
category | - | 값이 유한개로 정해져 있는 문자열값 | - 사용자 이름 (user_name), - year, month, day, weekday |
수치형 데이터 (Quantitative Data) | 범주형 데이터 (Categorical Data) |
수치를 값으로 수학적 활용이 가능 | 어떤 대상의 그룹을 나눌 때 사용 |
ex) 나이, 키, 온도 | ex) 성별, 성적, 별점 |
연속형 데이터 (Continuous data) | 이산형 데이터 (Discrete data) |
더 작은 단위로 쪼갤 수 있다. | 수를 세는 것만 가능하고 더 쪼갤 수 없다. |
ex) 1년 강수량, 체중 | ex) 책의 페이지수, 오늘 마주친 개의 수 |
순서형 데이터 (Ordinal data) | 명목형 데이터 (Nominal data) |
순서 관계가 있는 범주형 데이터 | 순서 관계가 없는 범주형 데이터 |
ex) 영화 별점 평가, 대학교 과목 성적 | ex) 개의 품종, 성별, 혈액형 |
