• 프로젝트 정의

    우울증 징후 판별을 위한 감성 분석 모델 개발

    의료진과 환자 간 면담 기록 데이터화, 감성 분석 모델을 통해 감성 추출 후 우울증 확률 계산

  • 담당 업무

    1) 한국어 감성 class 정의

    2) 데이터 수집

    3) 감성 분류 모델 개발

    (모델 개발 후 과제 배포 담당자에게 모델 인계)

  • 사용 기술

    1) 한국어 감성 분석 및 감정 표현 분류와 관련된 언어학 지식

    2) NLP-classifiacation model 개발 기술(최종 모델: Koelectra)

    3) Flask

  • 개발 언어

    python (framework: pytorch)

  • 수행 업무 요약
    • class 정의:

      한국어 감성 분석 및 감정 표현 분류와 관련된 언어학 지식을 활용하여 34종, 8종의 한국어 감성 분류(class 정보는 하단 개발 로그에서 확인 가능)

    • 데이터 수집:

      출처 수량
      data labeling 업체 수집 데이터(raw data: web crawling data) 302,028문장
      data labeling 업체 수집 데이터(raw data: aihub 한국어 SNS, 자유대화 데이터) 184,585문장
      aihub data (한국어 단발성 대화 데이터셋: 기쁨, 슬픔, 놀람, 분노, 공포, 혐오, 중립) 37,000문장
      aihub data (감성 대화 말뭉치: 기쁨, 당황, 분노, 불안, 상처, 슬픔) 28,000문장
      총 수량 551,613문장
    • 모델 개발

      Electra 기반의 감성 분류 모델 개발. (BERT 버전도 개발하였지만 Electra 성능이 더 좋아 Electra로 최종 선택)

      34종, 8종 감성 분류 모델 성능 평가 결과 각각 f1-score 78, 84로 측정

  • + 해당 모델은 현재 우울증 판별 사업, 아동 돌보미 봇 사업, 역사 인물 복원 사업 등 다양한 사업에 활용 중.