Ch5. 문자열 데이터 다루기 2 Ch5. 문자열 데이터 다루기 2 데이터 다운로드 링크: https://www.kaggle.com/PromptCloudHQ/imdb-data # 데이터 불러오기 DATA=read.csv("C:\\R/IMDB-Movie-Data.csv") Genre 변수에서 대표 장르만 뽑아내기 다시 Genre 변수로 돌아오도록 하겠습니다. 하나의 영화는 여러개의 Genre에 해당되지만, 일반적으로 가장 대표적인 Genre를 맨 앞에 표기합니다. 그러므로 각 영화의 대표장르를 나타내는 변수를 한번 만들어보도록 하겠습니다. # 첫번째 영화의 장르만 가져와서 문자열 분리 실행 strsplit(as.character(DATA$Genre[1]),',') ## [[1]] ## [1] "Action" "Adventure" "Sci-Fi" strsplit 데이터를 쓰면 결과값은 2차원 리스트로 나오게 됩니다. 그러므로 Index또한 2차원 리스트에 맞게 설정을 해주어야합니다. 어려울 수 있지만 이 2개만 확인하면 Index구분은 어렵지 않습니다. [[1]] -> 2차원 리스트 중 첫번째 리스트임을 의미 [1] -> 2차원 리스트 중 첫번째 리스트 안의 첫번째 값을 의미 [[1]]은 strsplit 함수의 출력결과인 c('Action', “Adventure”, “Sci-Fi”) 를 의미. [1]은 [[1]]안에서의 첫번째 값인 'Action'을 나타냄. [2]인 경우 “Adventure” strsplit(as.character(DATA$Genre[1]),',')[[1]][1] # Action ## [1] "Action" strsplit(as.char...