인문학
사회과학
자연과학
공학
의약학
농수해양학
예술체육학
복합학
지원사업
학술연구/단체지원/교육 등 연구자 활동을 지속하도록 DBpia가 지원하고 있어요.
커뮤니티
연구자들이 자신의 연구와 전문성을 널리 알리고, 새로운 협력의 기회를 만들 수 있는 네트워킹 공간이에요.
이용 11
초록·키워드
Google Play Store 는 전 세계적으로 가장 많은 모바일 어플리케이션(Mobile Application)을 확보한 온라인 앱 스토어(Application store)로 사용자들이 자발적으로 구매한 상품에 대한 리뷰 및 평점을 적극적으로 제공하고 있는 특징이 있다. 이러한 리뷰 및 평점은 이후 구매자 뿐 아니라 판매자, 그리고 플랫폼 관리자에게 매우 유용한 정보로 활용된다. 하지만 작성자의 실수나 5점 척도 중 평점3점, 평점4점과 같은 중간 점수를 부여할 때 기준이 모호함으로 인하여 사용자 리뷰의 내용과 사용자가 부여한 평점 간의 불일치가 발생하기 때문에 사용자의 진정한 의도 및 선호도를 정확히 파악하는데 어려움이 있었다.
사용자 리뷰를 바탕으로 사용자가 부여한 평점을 예측하고자 하는 시도는 Google Play Store뿐 아니라 Yelp, Amazon shopping, IMDB 영화 평점 리뷰 예측 등 다양한 시도가 있어왔다. 하지만 대부분의 선행 연구에서는 사용자가 부여한 5점 척도 평점을 가공하여 긍정/부정과 같은 이진분류(Binary Classification)을 수행하거나 긍정/중립/부정으로 구분하는 3가지 클래스(Class) 분류를 수행하는 연구가 대부분 이었으며, 일부 5가지 클래스 분류를 수행하는 모델에 대한 선행 연구에서도 만족할 만한 성능을 보여주지 못하고 있었다.
본 연구에서는 대규모 사전 학습 모델인 BERT(Bidirectional Encoder Representations from Transformers)와 LSTM(Long Short Term Memory), GRU(Gated Recurrent Units), Text-CNN(Convolutional Neural Network)과 같은 딥러닝(Deep Learning) 모델을 조합하여 Google Play Store 사용자 리뷰 점수를 5점 척도로 예측하는 모델을 제안하였다. 사용자의 입력 오류를 보정하기 위하여 키워드 기반 분석 도구인 VADER(Valence Aware Dictionary for Sentiment Reasoning) 감정 분석 점수를 조합하여 분류 정확도의 향상을 시도 하며, 분류 성능의 극대화를 위하여 비교적 분류가 잘 되는 평점 1 점, 5점 리뷰를 먼저 분류하고, 분류가 어려운 평점 2점, 3점, 4점 리뷰를 추가 분류하는 2단 분류 모델(Two-stage Classification Model)을 제안하였다. 최종적으로 제안된 방식으로 생성된 1단계 - 2단계 분류 모델들의 조합을 통해, 총 196개의 2단 분류 모델 조합의 성능을 비교하였으며, 이를 통해서 1단계 분류 모델과 2단계 분류 모델 조합에 따른 성능 변화를 관찰 하였다. 그리고 2단 분류 구조에서 추가적인 성능 향상을 위한 최적의 Voting 방법을 제안하고, 예측 결과에 대해 신뢰도를 측정할 수 있는 방법을 제안하여 향후 모델 사용 및 평가에 도움이 되도록 하였다.
실험을 통하여 BERT의 사전 학습 모델(Pre-Trained model)에 기반한 분류 모델이 전통적인 기계학습 및 Glove, Word2Vec으로 사전 학습된 워드 임베딩(Pre-Trained Word Embedding) 기반 딥러닝 모델들 대비 유의미하게 우수한 성능을 보이는 것을 증명하였으며, 2단 분류를 통하여 모델의 분류 성능을 극대화 할 수 있음을 보였다.
사용자 리뷰를 바탕으로 사용자가 부여한 평점을 예측하고자 하는 시도는 Google Play Store뿐 아니라 Yelp, Amazon shopping, IMDB 영화 평점 리뷰 예측 등 다양한 시도가 있어왔다. 하지만 대부분의 선행 연구에서는 사용자가 부여한 5점 척도 평점을 가공하여 긍정/부정과 같은 이진분류(Binary Classification)을 수행하거나 긍정/중립/부정으로 구분하는 3가지 클래스(Class) 분류를 수행하는 연구가 대부분 이었으며, 일부 5가지 클래스 분류를 수행하는 모델에 대한 선행 연구에서도 만족할 만한 성능을 보여주지 못하고 있었다.
본 연구에서는 대규모 사전 학습 모델인 BERT(Bidirectional Encoder Representations from Transformers)와 LSTM(Long Short Term Memory), GRU(Gated Recurrent Units), Text-CNN(Convolutional Neural Network)과 같은 딥러닝(Deep Learning) 모델을 조합하여 Google Play Store 사용자 리뷰 점수를 5점 척도로 예측하는 모델을 제안하였다. 사용자의 입력 오류를 보정하기 위하여 키워드 기반 분석 도구인 VADER(Valence Aware Dictionary for Sentiment Reasoning) 감정 분석 점수를 조합하여 분류 정확도의 향상을 시도 하며, 분류 성능의 극대화를 위하여 비교적 분류가 잘 되는 평점 1 점, 5점 리뷰를 먼저 분류하고, 분류가 어려운 평점 2점, 3점, 4점 리뷰를 추가 분류하는 2단 분류 모델(Two-stage Classification Model)을 제안하였다. 최종적으로 제안된 방식으로 생성된 1단계 - 2단계 분류 모델들의 조합을 통해, 총 196개의 2단 분류 모델 조합의 성능을 비교하였으며, 이를 통해서 1단계 분류 모델과 2단계 분류 모델 조합에 따른 성능 변화를 관찰 하였다. 그리고 2단 분류 구조에서 추가적인 성능 향상을 위한 최적의 Voting 방법을 제안하고, 예측 결과에 대해 신뢰도를 측정할 수 있는 방법을 제안하여 향후 모델 사용 및 평가에 도움이 되도록 하였다.
실험을 통하여 BERT의 사전 학습 모델(Pre-Trained model)에 기반한 분류 모델이 전통적인 기계학습 및 Glove, Word2Vec으로 사전 학습된 워드 임베딩(Pre-Trained Word Embedding) 기반 딥러닝 모델들 대비 유의미하게 우수한 성능을 보이는 것을 증명하였으며, 2단 분류를 통하여 모델의 분류 성능을 극대화 할 수 있음을 보였다.
목차
- 제 1장 서론 1제 2장 관련 연구 6제 3장 연구 사전 준비 93.1. 데이터 수집 및 전처리 93.1.1. 목표 데이터(Target Data) 선정 및 수집 93.1.2. 탐색적 데이터 분석(Exploratory Data Analysis) 103.1.3. 데이터 전처리(Data Preprocessing) 133.1.4. 불균형 데이터셋 163.2. 비교 모델 선정 및 실험 183.2.1. 머신러닝 기반 분류 모델 183.2.2. BERT를 적용하지 않은 딥러닝 기반 분류 모델 203.2.2.1. 워드 임베딩(Word Embedding) – Word2Vec, Glove 203.2.2.2. BiLSTM(Bidirectional Long Short Term Memory) 213.2.2.3. BiGRU(Bidirectional Gated Recurrent Unit) 223.2.2.4. Text-CNN(Convolutional Neural Network) 243.2.3. 2단 분류 비교 모델 27제 4장 제안 방법 294.1. BERT의 사전 학습 모델에 기반한 분류 모델 294.1.1. BERT 294.1.2. BERT와 RNN, CNN 계열 모델의 조합 324.1.3. 키워드 기반 감정분석 점수 활용 334.1.4. BERT의 사전 학습 모델에 기반한 분류 모델 종합 344.2. 2단 분류 모델 적용 354.3. 2단 분류 모델의 Voting 384.4. 예측 신뢰도 측정 434.4.1. 일반적인 분류 모델의 예측 신뢰도 측정 방법 434.4.2. 2단 분류 모델에서의 신뢰도 측정 방법 44제 5장 실험 및 평가 485.1. 실험 설계 485.1.1. 실험 데이터 구성 – 1단 분류 모델 495.1.2. 실험 데이터 구성 – 2단 분류 모델 515.1.3. 실험 환경 545.1.4. 분류 모델 준비 555.1.4.1. 1단 분류 모델 555.1.4.2. 2단 분류 모델 605.1.5. Voting 625.1.5.1. Simple Voting 625.1.5.2. 2단 Voting 645.1.6. 2단 분류 모델의 예측 신뢰도 측정 685.1.6.1. 딥러닝 모델을 이용하는 방법 685.1.6.2. 1단계와 2단계 분류의 Cross Entropy를 이용한 방법 715.2. 성능 평가 지표 725.3. 실험 결과 745.3.1. 1단 분류 모델 755.3.2. 2단 분류 모델 775.3.3. Voting 885.3.4. 예측 신뢰도 측정 90제 6장 결론 및 향후 연구 976.1. 논문 요약 976.2. 기대 효과 996.3. 향후 연구 100참고문헌 101ABSTRACT 105