목소리 음향 특징은 인지 상태를 말해줄까

한국어 화자 223명의 짧은 발성 녹음에서 뽑은 음향 특징만으로 인지 상태를 구분할 수 있을까? 모형 성능과 중요 특징, 나이·교육 차이라는 한계를 논문 한 편으로 정리한다.

인지 저하는 일찍 찾을수록 대응할 시간이 길어진다. 그런데 지금 쓰는 진단 방법은 자주 받기 어렵다. 임상 평가는 시간이 오래 걸리고, 뇌 영상 검사는 비싸고 장비가 필요하다. 고령 환자는 긴 검사를 꺼리기도 한다.

몇 분 동안 “아”, “이”, “퍼터커” 같은 소리를 내는 것만으로 선별할 수 있으면 검사 부담이 크게 줄어든다. 이 글이 다루는 질문은 다음과 같다. 한국어 화자가 짧은 발성 과제에서 낸 소리의 음향 특징만으로 인지 상태를 구분할 수 있을까?

이 질문에 답한 논문을 한 편 읽어 본다.

  • 제목: Exploring Voice Acoustic Features Associated with Cognitive Status in Korean Speakers: A Preliminary Machine Learning Study
  • 학술지: Diagnostics
  • 연도: 2024
  • DOI: 10.3390/diagnostics14242837

논문의 방법은 세 단계로 요약된다. 먼저 환자 223명이 여덟 가지 발성 과제를 수행하고, 연구진은 그 녹음에서 음향 특징을 뽑는다. 다음으로 머신러닝 모형 네 종류가 이 특징으로 인지 저하 여부를 맞히도록 학습한다. 마지막으로 모형이 어떤 특징에 기대어 판단했는지 해석한다. 저자는 이 연구를 예비 연구(preliminary study)라고 부른다.

글 전체에서 쓰는 용어는 다음과 같다.

  • 음향 특징(acoustic feature): 녹음 파형에서 계산한 숫자. 목소리의 떨림, 높낮이, 공명 위치 같은 성질을 수치로 나타낸다.
  • 기본주파수(fundamental frequency, F0): 주기적으로 반복되는 목소리 파형에서 가장 낮은 주파수. 목소리 높이에 해당한다.
  • 지터(jitter): 이웃한 진동 주기 사이에서 주기 길이가 얼마나 흔들리는지 나타내는 값. 주파수의 불안정성을 뜻한다.
  • 쉬머(shimmer): 이웃한 진동 주기 사이에서 진폭(소리 크기)이 얼마나 흔들리는지 나타내는 값.
  • 한국판 간이정신상태검사(Korean Mini-Mental State Examination, K-MMSE): 인지 기능을 평가하는 검사의 한국어판. 이 논문에서 집단을 나누는 기준이다.
  • 정밀도–재현율 곡선 아래 면적(Precision-Recall Area Under the Curve, PR-AUC): 모형 성능 지표. 집단 크기가 불균형할 때 주로 쓴다.
  • SHAP(Shapley Additive Explanations): 모형 예측에 각 특징이 얼마나 기여했는지 계산하는 해석 방법.

동기: 값싸고 부담 없는 인지 선별 도구가 필요하다

왜 음성 기반 선별이 중요한가

논문은 기존 진단 방법의 장벽을 다음과 같이 정리한다.

  • 비용이 높다.
  • 접근하기 어렵다.
  • 환자가 불편을 느끼고, 특히 고령 환자는 여러 단계의 검사를 꺼린다.

인공지능(AI)을 자기공명영상(MRI)이나 양전자방출단층촬영(PET) 같은 뇌 영상 자료에 적용한 연구는 진단 정확도가 높다. 다만 전문 장비와 시설이 있어야 해서 널리 보급하기 어렵다. 말하기에는 주의, 기억, 언어 구성, 운동 조절이 함께 관여한다. 그래서 저자는 말소리 분석을 보완 수단으로 본다. 저자가 그리는 목표는 일상에서 인지 기능을 정기적으로 확인하는 선별 도구다.

선행 연구와 이 논문의 기여

목소리와 인지 기능의 관계를 다룬 선행 연구는 여럿이다. 지터와 쉬머 같은 음성 섭동(perturbation) 특징이 초기 인지 저하를 찾는 데 쓸모가 있다는 보고가 있다. 쉬머가 진행된 인지 저하의 민감한 지표라는 연구도 있다.

그 밖의 특징을 다룬 연구도 있다.

  • 조화음 대 잡음비(harmonic-to-noise ratio, HNR)가 낮을수록 초기 인지 저하와 관련된다는 보고
  • 높낮이 변화와 말 속도 같은 운율 특징이 경도와 중증을 구분하는 데 쓸모 있다는 보고
  • 높은 포먼트(formant, 성도의 공명 주파수)의 변화가 조음 정밀도 저하를 반영한다는 보고

저자는 자기 연구의 기여를 세 가지로 정리한다.

  • 선행 연구가 주로 영어 화자를 다룬 데 비해, 이 연구는 한국어 화자의 말소리를 분석한다.
  • 8개 과제에서 184개 지표를 뽑아 함께 분석한다.
  • SHAP 분석으로 인지 상태 수준별 음향 특징의 상대적 중요도를 살핀다.

방법: 여덟 가지 발성 과제에서 184개 지표를 뽑아 네 모형으로 분류한다

논문은 연구 과정을 네 단계로 제시한다. 말소리를 모아 특징을 뽑고, K-MMSE 점수로 집단을 나누고, 모형을 만들고, 설명 가능한 AI로 해석한다. 이 글에서는 첫 단계를 녹음과 특징 추출로 나누어 다섯 단계로 정리했다. 실험·임상 연구의 구성인 참가자, 과제, 측정, 모형 순서에 해석 단계를 더한 것이다.

그림 1. 환자 223명의 K-MMSE 집단 나누기부터 SHAP 해석까지, 음향 특징으로 인지 상태를 분류하는 다섯 단계를 보여 준다.

자료와 참가자

참가자는 인지 저하가 의심되어 신경외과 외래를 찾은 한국인 환자 223명이다. 포함 기준은 다음과 같다.

  • 과제 지시를 이해하고 따를 수 있다.
  • 말소리에 영향을 주는 다른 신경학적 질환 병력이 없다.
  • 연구 참여에 동의했다.

경력 5년 넘는 언어재활사가 모든 참가자를 미리 확인했다. 지시 이해, 알아들을 수 있는 발화, 모든 과제 수행이 확인 항목이다. 연구는 경북대학교 칠곡병원 기관생명윤리위원회의 승인을 받았다.

1단계: K-MMSE 점수로 집단 나누기

  • 입력: 환자 223명의 K-MMSE 점수
  • 처리: 점수 구간에 따라 세 집단으로 나누고, 세 가지 이진 분류 문제를 정한다
  • 산출: 중증 72명, 경도 54명, 정상 97명
  1. 모든 환자가 의료진의 관찰 아래 K-MMSE를 받는다.
  2. 기존 지침과 연구를 따라 019점은 중증 인지 저하, 2023점은 경도 인지 저하, 24~30점은 인지 저하 없음(정상)으로 나눈다.
  3. 세 집단으로 분류 문제 세 개를 만든다. 중증 대 정상, 경도 대 정상, 중증+경도 대 정상이다.

K-MMSE는 시간·장소 지남력, 기억 등록, 주의와 계산, 회상, 언어, 공간·시각 인지를 평가한다. 저자는 이 점수 구간이 한국인 대상 연구에서 검증되었다고 설명한다.

집단 사이에는 나이와 교육 연수 차이가 있었다. 저자는 이 차이를 통제하지 않았다. 선별 단계에서는 노화로 생긴 인지 저하도 치매의 전조일 수 있으니 모두 찾아내는 편이 옳다는 판단이다. 집단별 평균 나이와 평균 교육 연수는 다음과 같다.

  • 중증 집단(72명): 평균 72.44세, 교육 7.10년
  • 경도 집단(54명): 평균 71.11세, 교육 8.24년
  • 정상 집단(97명): 평균 64.80세, 교육 10.93년

2단계: 여덟 가지 발성 과제 녹음

  • 입력: 참가자 223명
  • 처리: 모음 과제 4개와 교대운동(diadochokinetic, DDK) 과제 4개를 같은 조건에서 녹음한다
  • 산출: 참가자마다 8개 과제의 wav 녹음 파일

과제는 다음과 같다.

  1. 모음 지속 발성 /α/, /i/, /u/: 각 모음을 2~3초 유지한다. 발성 안정성을 평가한다.
  2. 모음 연장 /α-α-α/: /α/를 가능한 한 길게 유지한다. 최대 발성 시간과 호흡 조절을 평가한다.
  3. 교대운동속도(alternate motion rate, AMR) /puh-puh-puh/, /tuh-tuh-tuh/, /kuh-kuh-kuh/: 한 음절을 빠르게 되풀이한다. 말 운동 기능과 협응을 평가한다.
  4. 일련운동속도(sequential motion rate, SMR) /puh-tuh-kuh/: 서로 다른 음절을 차례로 낸다. 운동 계획과 순서 처리 능력을 평가한다.

두 종류의 과제를 함께 쓴 이유가 있다. 모음 과제는 발성 기관의 미세한 운동 조절을 드러낸다. DDK 과제는 운동 계획, 순서 처리, 타이밍 조절을 요구해서 인지–운동 손상에 민감하다.

녹음 조건은 다음과 같이 고정했다.

  • 주변 소음 50 dB 미만
  • 과제 지시 화면에서 55 cm 떨어져 선 자세
  • 입에서 30 cm 거리에 둔 단일지향성 마이크
  • 표본추출률 44,100 Hz, wav 형식 저장
  • 경력 5년 넘는 언어재활사가 모든 녹음을 진행

3단계: 음향 특징 추출

  • 입력: 8개 과제의 녹음 파일
  • 처리: 과제마다 음향 특징 23개를 계산한다
  • 산출: 참가자 1명당 지표 184개(23개 특징 × 8개 과제)

특징은 두 범주다.

  • 음질 특징: 지터 5종(local, absolute, RAP, PPQ5, DDP), 쉬머 6종(local, localdB, APQ3, APQ5, APQ11, DDA), HNR
  • 운율 특징: 발화 지속 시간, 평균 F0, F0의 표준편차(stdevF0), 포먼트 평균, F1~F4의 평균과 중앙값

지터는 이웃한 두 주기 길이 차이의 절댓값을 모두 더하고 (주기 수 − 1)로 나눈 뒤, 평균 주기로 나누고 100을 곱한다. 쉬머는 같은 계산을 주기 길이 대신 진폭에 적용한다. 두 값 모두 클수록 목소리가 불안정하다는 뜻이다.

변형 지표는 계산 범위가 다르다. APQ3, APQ5, APQ11은 각각 3주기, 5주기, 11주기 범위에서 진폭 변동을 평균한다. DDA 쉬머는 이웃한 진폭 차이들 사이의 차이를 평균한다. 뒤에서 보듯 이 DDA 쉬머가 결과의 핵심 특징으로 나온다.

HNR은 조화음 에너지를 잡음 에너지로 나눈 비에 로그를 씌우고 10을 곱한 값이다. 높을수록 잡음이 적은 맑은 목소리다. 조화음은 F0의 정수배 주파수다. 논문의 예처럼 F0가 100 Hz면 둘째 조화음은 200 Hz, 셋째 조화음은 300 Hz다.

특징 계산에는 Python 3.10.14를 썼다. 저자는 모음 과제와 DDK 과제의 특징을 따로 보지 않고 한 모형에 함께 넣었다. 특징 사이의 상호작용까지 모형이 학습하게 하려는 설계다.

4단계: 모형 학습과 평가

  • 입력: 분류 문제 세 개와 184개 지표
  • 처리: 모형 네 종류를 학습하고 PR-AUC로 비교한다
  • 산출: 분류 문제마다 가장 성능이 높은 모형 하나
  1. 모형 네 종류를 준비한다. 로지스틱 선형 분류기(LM), 랜덤 포레스트(RF), 그래디언트 부스팅(GBM), 심층신경망(DNN)이다.
  2. 자동 머신러닝(automated machine learning, AutoML)으로 하이퍼파라미터(모형 설정값)를 찾는다.
  3. 5겹 교차검증(자료를 다섯 묶음으로 나누어 번갈아 검증하는 방식)으로 과적합을 줄인다.
  4. 학습 자료와 시험 자료를 8:2로 나누고, 시험 자료에서 성능을 계산한다.

변환기(transformer)나 합성곱 신경망 같은 최신 구조를 쓰지 않은 이유가 있다. 자료가 적고 특징이 이미 숫자 형태여서다. 분류 문제별 인원은 중증 대 정상 72명과 97명, 경도 대 정상 54명과 97명, 중증+경도 대 정상 126명과 97명이다.

PR-AUC를 주 지표로 정한 이유는 집단 크기가 불균형하고 시험 자료가 적어서다. 이런 조건에서 특정 임계값에 의존하는 정밀도나 재현율 하나만 보면 판단이 흔들린다. PR-AUC는 임계값을 바꿔 가며 정밀도와 재현율을 그린 곡선의 아래 면적이다.

PR-AUC에는 기준선이 있다. 기준선은 양성 표본 수를 전체 표본 수로 나눈 값이고, 제대로 학습한 모형은 이 값보다 높아야 한다. 중증 대 정상이면 72÷(72+97)=0.426이다. 경도 대 정상이면 54÷(54+97)=0.358이다. 두 값은 논문이 보고한 기준선과 같다.

중증+경도 대 정상은 계산이 맞지 않는다. 방법 절의 인원(126명과 97명)으로 계산하면 126÷223=0.565다. 그런데 논문이 보고한 기준선은 0.677이고, 결과 절은 인원을 151명과 72명으로 적었다. 151÷223=0.677이므로 보고된 기준선은 결과 절의 인원과 맞는다. 논문 안의 두 숫자 가운데 어느 쪽이 맞는지는 근거만으로 판단할 수 없다.

5단계: SHAP으로 중요 특징 해석

  • 입력: 분류 문제별로 PR-AUC가 가장 높은 모형
  • 처리: 특징마다 SHAP 값을 계산한다
  • 산출: 분류 문제별 중요 특징 상위 20개

SHAP은 협력 게임 이론의 섀플리 값(Shapley value)을 모형 해석에 옮긴 방법이다. 한 특징을 넣었을 때와 뺐을 때 예측이 얼마나 달라지는지 계산한다. 이 계산을 가능한 모든 특징 조합에서 반복해 평균을 낸다.

결과 그림에서 빨간색은 특징 값이 높은 경우, 파란색은 낮은 경우다. SHAP 값이 양수면 모형이 그 특징을 표적 집단 예측에 쓰고, 음수면 비표적 집단 예측에 쓴다는 뜻이다. 저자는 분류 문제마다 PR-AUC가 가장 높은 모형에서 상위 20개 특징을 분석했다.

결과: 음향 특징만으로 기준선보다 높은 성능을 냈지만 나이와 교육 차이가 섞여 있다

집단 특성 비교: 정상 집단이 더 젊고 교육 연수가 길다

연구진은 모형 결과를 보기 전에 집단 특성을 비교했다. 자료가 정규분포를 따르지 않고 분산이 달라서 크러스컬–월리스 검정을 썼다. 나이는 레빈 검정 p = 0.017이었다.

  • 나이: 세 집단 사이 차이가 유의했다(H = 24.07, p < 0.001).
  • 교육 연수: 차이가 유의했다(H = 32.83, p < 0.001).
  • 성별: 차이가 유의하지 않았다(χ2 = 2.79, p = 0.248).

본페로니 보정을 한 사후 비교에서 나이 차이는 중증 대 정상(p < 0.001)과 경도 대 정상(p = 0.003)에서 나타났다. 중증 대 경도는 p = 0.956으로 차이가 없었다. 교육 연수도 같은 형태다. 중증 대 정상과 경도 대 정상은 p < 0.001, 중증 대 경도는 p = 0.532였다. 정상 집단만 따로 젊고 교육 연수가 길다는 뜻이다.

모형 성능 비교: 두 문제에서 DNN, 한 문제에서 RF

분류 문제 세 개의 PR-AUC를 모형별로 정리하면 다음과 같다.

모형중증 대 정상경도 대 정상중증+경도 대 정상
DNN0.7370.7260.659
RF0.5160.6300.715
GBM0.7160.5830.682
LM0.6320.5970.680

출처: Lee, J. 외, “Exploring Voice Acoustic Features Associated with Cognitive Status in Korean Speakers”, Diagnostics(2024)의 표 5에서 PR-AUC 값만 뽑아 재구성했다. 원 논문은 CC BY 4.0(https://creativecommons.org/licenses/by/4.0/) 라이선스로 공개되었다.

PR-AUC 기준으로 중증 대 정상과 경도 대 정상에서는 DNN이, 중증+경도 대 정상에서는 RF가 가장 높았다. 다른 지표로 보면 순위가 달라진다. 중증 대 정상에서 수신자 조작 특성 곡선 아래 면적(AUC)은 GBM이 0.730으로 DNN의 0.716보다 높았다. 경도 대 정상에서 정확도는 RF와 GBM이 0.800, DNN이 0.667이었다.

PR-AUC가 가장 높은 모형의 정밀도와 재현율도 살펴볼 만하다. 경도 대 정상의 DNN은 재현율 1.000, 정밀도 0.524였다. 중증+경도 대 정상의 RF는 정밀도 1.000, 재현율 0.521이었다. 논문은 이 차이를 따로 논의하지 않는다. 필자가 보기에는 선별 도구에서 환자를 놓치지 않는 재현율이 중요하므로, 이 관점에서는 두 모형의 쓰임새가 서로 다르다.

기준선 대비 향상: 경도 대 정상에서 가장 컸다

분류 문제PR-AUC 1위 모형PR-AUC기준선
중증 대 정상DNN0.7370.426
경도 대 정상DNN0.7260.358
중증+경도 대 정상RF0.7150.677
그림 2. 음향 특징만 쓴 모형의 PR-AUC는 세 문제 모두 기준선보다 높았고, 향상 폭은 경도 대 정상에서 가장 컸다.

출처: Lee, J. 외, Diagnostics(2024)의 표 5와 본문 수치를 재구성했다. 원 논문은 CC BY 4.0(https://creativecommons.org/licenses/by/4.0/) 라이선스로 공개되었다.

저자는 기준선 대비 향상 폭을 중증 대 정상 73%, 경도 대 정상 103%, 중증+경도 대 정상 6%로 보고했다. 계산하면 0.737÷0.426=1.73, 0.726÷0.358=2.03, 0.715÷0.677=1.06이다. 마지막 문제는 기준선이 이미 높아서 향상 폭이 작다.

저자는 세 문제의 성능 차이가 크지 않다고 스스로 적었다. 선행 연구와의 비교도 조심해야 한다. Framingham Heart Study 자료를 쓴 연구는 음향, 언어, 인구학 변수를 함께 넣어 AUC 0.942를 보고했다. 다른 연구는 인구학 변수만 쓴 AUC 0.773이 음향 특징을 더하자 0.812로 올랐다고 보고했다. 이 논문은 음향 특징만 쓰고 PR-AUC를 주 지표로 정했으므로, 숫자를 그대로 비교하기는 어렵다.

중요 음향 특징: /i/의 DDA 쉬머와 /puh-tuh-kuh/의 F0 표준편차

분류 문제마다 SHAP 상위 특징은 다음과 같다.

중증 대 정상(DNN)

  • 1위는 /i/ 과제의 DDA 쉬머다. 값이 높을수록 정상으로 예측했다.
  • /tuh-tuh-tuh/ 과제의 F3 평균이 높으면 중증으로 예측했다.
  • /α-α-α/ 과제의 DDA 쉬머가 높으면 정상으로 예측했다.

경도 대 정상(DNN)

  • 1위는 역시 /i/ 과제의 DDA 쉬머다. 값이 높을수록 정상으로 예측했다.
  • /kuh-kuh-kuh/, /α/, /u/ 과제의 쉬머 계열 특징도 영향이 컸다.
  • /u/ 과제의 APQ5 쉬머가 높을수록 경도로 예측했다.

중증+경도 대 정상(RF)

  • 1위는 /puh-tuh-kuh/ 과제의 stdevF0다. 값이 낮으면 인지 저하로, 높으면 정상으로 예측했다.
  • /i/ 과제의 DDA 쉬머는 값이 높을수록 인지 저하로 예측했다.
  • /puh-tuh-kuh/ 과제의 DDP 지터는 값이 높을수록 인지 저하로 예측했다.
  • /i/와 /u/ 과제의 F2 중앙값, /kuh-kuh-kuh/ 과제의 F4 중앙값은 대체로 값이 높을수록 인지 저하로 예측했다.
  • /tuh-tuh-tuh/와 /kuh-kuh-kuh/ 과제의 APQ3 쉬머는 값이 높을수록 정상으로 예측했다.

저자는 /i/ 과제의 DDA 쉬머가 여러 분류 문제에서 중요하게 나온 점을 주목한다. /i/ 모음은 혀의 위치를 정밀하게 조절하고 성도를 좁게 유지해야 하는 소리다. /puh-tuh-kuh/는 입술, 치조, 연구개 자음을 빠르게 오가야 해서 인지–운동 부담이 크다. 저자는 stdevF0의 중요도가 이 부담을 반영할 수 있다고 해석한다.

필자가 보기에 한 가지를 짚어야 한다. /i/ 과제의 DDA 쉬머는 세 문제 모두에서 중요하게 나왔지만, 영향의 방향은 문제마다 다르다. DNN 두 개는 값이 높을수록 정상으로 예측했고, RF는 값이 높을수록 인지 저하로 예측했다. 쉬머 값이 높으면 목소리가 불안정하다는 뜻이고, 고령일수록 쉬머가 커진다는 선행 연구도 있다. 그래서 이 특징을 인지 상태의 지표로 쓰려면 방향부터 다시 확인해야 한다.

의의와 한계

무엇이 달라지는가

이 논문이 새로 한 일은 다음과 같다.

  • 한국어 화자 223명의 말소리로 인지 상태 분류를 시도했다.
  • 모음 과제와 DDK 과제 8개에서 184개 지표를 뽑아 한 모형에 함께 넣었다.
  • 인구학 변수나 언어 내용 없이 음향 특징만으로 세 문제 모두에서 기준선보다 높은 PR-AUC를 얻었다. 다만 향상 폭은 문제마다 달랐고, 중증+경도 대 정상에서는 6%에 그쳤다. 집단 사이의 나이와 교육 차이가 이 결과에 섞였을 가능성도 저자가 밝혔다.
  • 중증과 경도를 따로 나누어 분류 문제별로 중요 특징을 비교했다.
  • 과제와 특징의 조합 단위로 중요도를 보고했다. 대표 조합은 /i/의 DDA 쉬머와 /puh-tuh-kuh/의 stdevF0다.

실무자에게 주는 쓸모

선별 서비스를 기획하는 실무자에게 이 논문은 구체적인 녹음 절차를 제공한다. 과제 8개의 내용, 마이크 거리 30 cm, 주변 소음 50 dB 미만, 표본추출률 44,100 Hz가 모두 적혀 있다. 자체 자료를 모을 때 이 조건을 그대로 따르면 결과를 이 논문과 비교할 수 있다.

평가 방식도 참고할 만하다. 집단 크기가 불균형하면 정확도 하나로는 판단이 어렵다. PR-AUC와 기준선을 함께 보고하는 방식은 다른 선별 모형을 평가할 때도 바로 쓸 수 있다.

연구자에게 주는 쓸모

연구자에게는 검증할 가설 목록이 생긴다. 어떤 과제의 어떤 특징이 인지 상태와 관련되는지 후보가 좁혀졌다. 저자가 제안한 후속 연구 방향은 다음과 같다.

  • 나이를 맞춘 집단과 교육 수준별 층화 분석
  • 같은 사람을 여러 해 추적하는 종단 연구
  • 인구학 변수를 통계로 보정한 분석
  • 여러 언어를 비교해 음성 지표가 언어마다 다른지 확인하는 연구

논문이 밝힌 한계

논문이 스스로 밝힌 한계는 여섯 가지다.

  • 정상 집단이 더 젊고 교육 연수가 길다. 중요 특징이 인지 저하가 아니라 노화나 교육 효과를 반영했을 수 있다.
  • 특징별 집단 차이를 통계로 검증하지 않았다.
  • 성능을 기존 선별 방법과 비교하지 않았다.
  • 과제 8개를 모두 수행하는 시간이 환자에게 부담일 수 있다.
  • 녹음과 분석의 기술 요건을 표준화하고, 여러 임상 환경에서 측정의 신뢰도와 재현성을 확인해야 한다.
  • 표본이 223명이라 성별에 따른 차이 같은 세부 분석은 더 큰 연구가 필요하다.

저자는 이런 이유로 결과를 확정된 바이오마커가 아니라 개념 증명(proof-of-concept)으로 읽어야 한다고 적었다. 자료는 진행 중인 연구의 일부라 공개되지 않았다.

필자가 보는 적용 조건

아래는 논문에 적힌 내용이 아니라 필자가 실무 적용을 염두에 두고 덧붙이는 조건이다.

  • 비교군의 나이와 교육 연수를 맞춰야 한다. 맞추지 않으면 모형이 젊은 목소리와 나이 든 목소리를 구분하는 것인지 확인할 수 없다.
  • 시험 자료 규모를 확인해야 한다. 논문은 문제별 시험 자료 인원을 따로 적지 않았다. 학습과 시험 자료를 8:2로 나누었으므로 시험 자료는 각 문제 인원의 일부에 그친다. 이 정도 규모면 성능 수치가 흔들리기 쉽다.
  • 중요 특징의 방향이 분류 문제마다 같은지 먼저 확인해야 한다. /i/의 DDA 쉬머처럼 방향이 바뀌는 특징은 선별 규칙으로 쓰기 어렵다.
  • 수면이나 시선 같은 다른 자료와 비교한 내용은 이 논문에 없다. 논문은 뇌 영상과의 대비만 다룬다. 음성이 다른 자료보다 저렴하고 정확한지는 같은 대상자에게 여러 자료를 함께 모아 비용과 성능을 비교해야 판단할 수 있다.
  • 집에서 쓰는 선별 도구로 가려면 녹음 환경이 달라진다. 이 연구는 소음 50 dB 미만의 통제된 방에서 녹음했으므로, 일상 환경에서 같은 성능이 나오는지는 따로 확인해야 한다.

바로 해 볼 일

자기 자료로 이 논문의 절차를 따라 하는 첫 단계는 다음 세 가지다.

  1. 분류 문제마다 PR-AUC 기준선을 먼저 계산한다. 양성 인원을 전체 인원으로 나누면 된다. 이 논문의 중증 대 정상이면 72÷(72+97)=0.426이다. 모형 성능은 항상 이 기준선과 나란히 적는다.
  2. 집단을 나눈 직후 나이, 교육 연수, 성별을 비교한다. 논문처럼 크러스컬–월리스 검정과 본페로니 보정 사후 비교를 쓰면 정상 집단만 따로 젊은지 바로 확인할 수 있다.
  3. 과제 8개를 한꺼번에 하기 어렵다면 /i/ 지속 발성과 /puh-tuh-kuh/ 반복 두 과제부터 녹음한다. 마이크 30 cm, 소음 50 dB 미만, 44,100 Hz 조건을 지키고, DDA 쉬머와 stdevF0가 집단마다 어떤 방향으로 다른지 확인한다.

키워드

함께 읽을 글