안녕하세요. 저번 sklearn LDA 토픽 모델링 게시물에 이어서 이번에는 선정한 토픽에 대해 기간별로 어떻게 변화하는지를 확인해 보도록 하겠습니다. 데이터 준비 데이터는 저번 게시물에서 사용한 데이터를 사용하겠습니다. - 데이터: 공공데이터 포탈의 '공정거래위원회_소비자 민원학습데이터 처리기관별 소비자 상담내역' 링크 들어가셔서 '공정거래위원회_소비자 민원학습데이터 처리기관별 소비자 상담내역_20211227.csv' 파일을 다운받아 주세요. import pandas as pd df = pd.read_csv('공정거래위원회_소비자 민원학습데이터 처리기관별 소비자 상담내역_20211227.csv',encoding='cp949') print(df.head()) print(df.shape) 약 5만개의 행..
'topicModeling' 3
안녕하세요. 저번시간에는 토픽 모델링을 할 때 gensim으로 하는 방법을 알아보았는데, 이번에는 sklearn을 활용하여 LDA를 하는 방법을 알아보도록 하겠습니다. 데이터 준비 공공데이터 포탈의 '공정거래위원회_소비자 민원학습데이터 처리기관별 소비자 상담내역' 을 활용하여 LDA를 해보도록 하겠습니다. 아래의 링크에서 csv파일을 다운받아 주세요. https://www.data.go.kr/data/15098351/fileData.do#tab-layer-file 공정거래위원회_소비자 민원학습데이터 처리기관별 소비자 상담내역_20211227 공정거래위원회의 소비자 민원학습 데이터로, 소비자들의 민원상담을 처리한 기관별 상담데이터를 보여주는 데이터입니다. 이 데이터는 기관명 상위기관을 포함하고 있습니..
안녕하세요. 이번에는 한국어 데이터셋을 가지고 gensim을 사용한 LDA 토픽 모델링 실습을 해보도록 하겠습니다. 데이터 준비 테이터셋으로 '청와대 국민청원' 에 만료된 청원 데이터를 사용하도록 하겠습니다. 아래 사이트 접속 후 https://github.com/akngs/petitions GitHub - akngs/petitions: 청와대 국민청원 데이터 청와대 국민청원 데이터. Contribute to akngs/petitions development by creating an account on GitHub. github.com petition_sampled.csv 를 클릭하여 다운받아 주세요. 전체 데이터는 데이터 용량이 커서 샘플 데이터를 사용하겠습니다. 파일 불러오기 다운받은 파일중 5개만..