기본 콘텐츠로 건너뛰기

라벨이 3.4.1 원하는 통계값 뽑아내기인 게시물 표시

3.4.1 통계값 뽑아내기

Ch5. 통계값 뽑아내기 Ch5. 통계값 뽑아내기 데이터 다운로드 링크: https://www.kaggle.com/liujiaqi/hr-comma-sepcsv # 코드 실행전에 처리되어 있어야 하는 데이터 전처리 DATA = read.csv('C:/R/HR_comma_sep.csv') DATA$left = as.factor(DATA$left) DATA$Work_accident = as.factor(DATA$Work_accident) DATA$promotion_last_5years = as.factor(DATA$promotion_last_5years) 데이터 요약 보기 summary(DATA$salary) ## high low medium ## 1237 7316 6446 summary(DATA$satisfaction_level) ## Min. 1st Qu. Median Mean 3rd Qu. Max. ## 0.0900 0.4400 0.6400 0.6128 0.8200 1.0000 변수가 Factor 형태일 때는 각 level(Low, Mid, High)에 해당하는 집계 Count를 나타내주며, Numeric 형태일 때는 최솟값, 최댓값, 평균 및 각 분위수를 나타내줍니다. 분위수(quantile)란? 변수를 오름차순으로 정리하였을 때, 특정 % 위치에 해당되는 값을 의미합니다. 예를 들어, Q1은 1분위수로 하위 25%에 해당되는 직원의 satisfaction_level값을 나타내줍니다. Median(중위수)는 중간(50%)에 해당되는 직원의 satisfaction_level을 나타내주며, Q3( 하위 75%, 상위 25%)의 기준에 해당되는 직원의 satisfaction_level을 의미합니다. 분위수 계산 summary 함수를 쓰면, 기본적인 분위수들은 바로 나오지만, 다른 %에 해당되는 분위수를 알고싶...