[R] 탐색적 데이터 분석: 단일변수 데이터 분석
Y
Yerim
- R
table(벡터) # 도수분포표
table(벡터)/length(벡터) # 비율barplot(dataset, main = '제목')pie(dataset, main='제목')install.packages('carData')
library(carData)
# (1) 데이터 준비
room.class <- TitanicSurvival$passengerClass # 선실 정보
room.class
# (2) 도수 분포 계산
tbl <- table(room.class)
tbl
sum(tbl) # 전체 탑승객수
# (3) 막대그래프 작성
barplot(tbl, main = '선실별 탑승객',
xlab = '선실 등급',
ylab = '탑승객수',
col = c('blue', 'green', 'yellow'))
# (4) 원그래프 작성
tbl/sum(tbl)
par(mar=c(1, 1, 4, 1))
pie(tbl, main='선실별 탑승객',
col = c('blue', 'green', 'yellow'))
par(mar=c(5.1, 4.1, 4.1, 2.1))mean(data) # 평균값
median(data) # 중앙값
mean(data, trim=0.n) # 절사평균quantile(data)
quantile(data, (0;10)/10) # 10% 구간으로 나누어 계산var(data) # 분산
sd(data) # 표준편차
range(data) # 값의 범위
diff(range(data)) # 최댓값, 최솟값 차이hist(dataset, main = '제목')boxplot(dataset, main = '제목')
boxplot(y~x, data=dataset, main='제목') # 그룹이 있는 자료의 상자그림
boxplot.stats(dataset) # 상자그림의 정확한 값들# (1) 데이터 준비
grad <- state.x77[, 'HS Grad']
grad
# (2) 사분위수
summary(grad)
var(grad) # 분산
sd(grad) # 표준편차
# (3) 히스토그램
hist(grad, main = '주별 졸업률',
xlab='졸업률',
ylab = '주의 개수',
col = 'orange')
# (4) 상자그림
boxplot(grad, main='주별 졸업률',
col = 'orange')
# (5) 졸업률이 가장 낮은 주
idx <- which(grad==max(grad))
grad[idx]
# (6) 졸업률이 가장 높은 주
idx <- which(grad == max(grad))
grad[idx]
# (7) 졸업률이 평균 이하인 주
idx <- which(grad<mean(grad))
grad[idx]