-
프로젝트 정의
우울증 징후 판별을 위한 감성 분석 모델 개발
의료진과 환자 간 면담 기록 데이터화, 감성 분석 모델을 통해 감성 추출 후 우울증 확률 계산
-
담당 업무
1) 한국어 감성 class 정의
2) 데이터 수집
3) 감성 분류 모델 개발
(모델 개발 후 과제 배포 담당자에게 모델 인계)
-
사용 기술
1) 한국어 감성 분석 및 감정 표현 분류와 관련된 언어학 지식
2) NLP-classifiacation model 개발 기술(최종 모델: Koelectra)
3) Flask
-
개발 언어
python (framework: pytorch)
- 수행 업무 요약
-
class 정의:
한국어 감성 분석 및 감정 표현 분류와 관련된 언어학 지식을 활용하여 34종, 8종의 한국어 감성 분류(class 정보는 하단 개발 로그에서 확인 가능)
-
데이터 수집:
출처 수량 data labeling 업체 수집 데이터(raw data: web crawling data) 302,028문장 data labeling 업체 수집 데이터(raw data: aihub 한국어 SNS, 자유대화 데이터) 184,585문장 aihub data (한국어 단발성 대화 데이터셋: 기쁨, 슬픔, 놀람, 분노, 공포, 혐오, 중립) 37,000문장 aihub data (감성 대화 말뭉치: 기쁨, 당황, 분노, 불안, 상처, 슬픔) 28,000문장 총 수량 551,613문장 -
모델 개발
Electra 기반의 감성 분류 모델 개발. (BERT 버전도 개발하였지만 Electra 성능이 더 좋아 Electra로 최종 선택)
34종, 8종 감성 분류 모델 성능 평가 결과 각각 f1-score 78, 84로 측정
-
- + 해당 모델은 현재 우울증 판별 사업, 아동 돌보미 봇 사업, 역사 인물 복원 사업 등 다양한 사업에 활용 중.