'topicModeling' 3

[NLP] LDA를 활용하여 토픽 트렌드 보기

안녕하세요. 저번 sklearn LDA 토픽 모델링 게시물에 이어서 이번에는 선정한 토픽에 대해 기간별로 어떻게 변화하는지를 확인해 보도록 하겠습니다. 데이터 준비 데이터는 저번 게시물에서 사용한 데이터를 사용하겠습니다. - 데이터: 공공데이터 포탈의 '공정거래위원회_소비자 민원학습데이터 처리기관별 소비자 상담내역' 링크 들어가셔서 '공정거래위원회_소비자 민원학습데이터 처리기관별 소비자 상담내역_20211227.csv' 파일을 다운받아 주세요. import pandas as pd df = pd.read_csv('공정거래위원회_소비자 민원학습데이터 처리기관별 소비자 상담내역_20211227.csv',encoding='cp949') print(df.head()) print(df.shape) ​약 5만개의 행..

NLP

[NLP] 한국어 토픽 모델링 - LDA 활용방법(sklearn)

안녕하세요. 저번시간에는 토픽 모델링을 할 때 gensim으로 하는 방법을 알아보았는데, 이번에는 sklearn을 활용하여 LDA를 하는 방법을 알아보도록 하겠습니다. ​데이터 준비 공공데이터 포탈의 '공정거래위원회_소비자 민원학습데이터 처리기관별 소비자 상담내역' 을 활용하여 LDA를 해보도록 하겠습니다. ​ 아래의 링크에서 csv파일을 다운받아 주세요. https://www.data.go.kr/data/15098351/fileData.do#tab-layer-file 공정거래위원회_소비자 민원학습데이터 처리기관별 소비자 상담내역_20211227 공정거래위원회의 소비자 민원학습 데이터로, 소비자들의 민원상담을 처리한 기관별 상담데이터를 보여주는 데이터입니다. 이 데이터는 기관명 상위기관을 포함하고 있습니..

NLP

[NLP] 한국어 토픽 모델링 - LDA 활용방법(gensim)

안녕하세요. 이번에는 한국어 데이터셋을 가지고 gensim을 사용한 LDA 토픽 모델링 실습을 해보도록 하겠습니다. 데이터 준비 테이터셋으로 '청와대 국민청원' 에 만료된 청원 데이터를 사용하도록 하겠습니다. 아래 사이트 접속 후 https://github.com/akngs/petitions GitHub - akngs/petitions: 청와대 국민청원 데이터 청와대 국민청원 데이터. Contribute to akngs/petitions development by creating an account on GitHub. github.com petition_sampled.csv 를 클릭하여 다운받아 주세요. 전체 데이터는 데이터 용량이 커서 샘플 데이터를 사용하겠습니다. 파일 불러오기 다운받은 파일중 5개만..

NLP