语音声学特征能否反映认知状态

仅凭从223名韩语使用者的简短发声录音中提取的声学特征,能否区分认知状态?本文通过一篇论文,梳理了模型性能、重要特征,以及年龄和教育程度差异所带来的局限。

本文译自韩文原文。 韩文原文

认知衰退发现得越早,留给应对的时间就越长。然而,目前使用的诊断方法很难做到频繁检查。临床评估耗时较长,脑影像检查价格昂贵且需要专门设备。老年患者也往往不愿接受冗长的检查。

如果只需用几分钟发出”啊""衣""pə-tə-kə”之类的声音就能完成筛查,检查负担会大大减轻。本文要讨论的问题是:仅凭韩语使用者在简短发声任务中发出的声音的声学特征,能否区分其认知状态?

下面来读一篇回答了这一问题的论文。

  • 标题:Exploring Voice Acoustic Features Associated with Cognitive Status in Korean Speakers: A Preliminary Machine Learning Study
  • 期刊:Diagnostics
  • 年份:2024
  • DOI:10.3390/diagnostics14242837

论文的方法可概括为三步。首先,223 名患者完成八项发声任务,研究者从录音中提取声学特征。其次,四类机器学习模型利用这些特征学习判断是否存在认知衰退。最后,解释模型依据哪些特征做出判断。作者称这项研究为预研究(preliminary study)。

全文使用的术语如下。

  • 声学特征(acoustic feature):由录音波形计算得到的数值。用数值表示嗓音的颤动、高低、共鸣位置等性质。
  • 基频(fundamental frequency, F0):周期性重复的嗓音波形中最低的频率。对应嗓音的音高。
  • 频率微扰(jitter):相邻振动周期之间周期长度的波动程度。表示频率的不稳定性。
  • 振幅微扰(shimmer):相邻振动周期之间振幅(音量)的波动程度。
  • 韩国版简易精神状态检查(Korean Mini-Mental State Examination, K-MMSE):评估认知功能的检查的韩语版。是本文论文划分组别的依据。
  • 精确率–召回率曲线下面积(Precision-Recall Area Under the Curve, PR-AUC):模型性能指标。通常在组别规模不均衡时使用。
  • SHAP(Shapley Additive Explanations):计算各特征对模型预测贡献大小的解释方法。

动机:需要廉价且负担小的认知筛查工具

为什么基于语音的筛查很重要

论文将现有诊断方法的障碍归纳如下。

  • 成本高。
  • 难以获得。
  • 患者感到不适,尤其是老年患者不愿接受多个步骤的检查。

将人工智能(AI)应用于磁共振成像(MRI)或正电子发射断层扫描(PET)等脑影像数据的研究诊断准确率很高。但这需要专门的设备和设施,难以广泛推广。说话涉及注意、记忆、语言组织和运动控制的共同参与。因此作者将语音分析视为一种补充手段。作者设想的目标是一种能在日常生活中定期检查认知功能的筛查工具。

既往研究与本文的贡献

关于嗓音与认知功能关系的既往研究有多项。有报告称,频率微扰和振幅微扰等语音微扰(perturbation)特征有助于发现早期认知衰退。也有研究认为,振幅微扰是进展期认知衰退的敏感指标。

还有研究涉及其他特征。

  • 有报告称,谐噪比(harmonic-to-noise ratio, HNR)越低,与早期认知衰退越相关
  • 有报告称,音高变化和语速等韵律特征有助于区分轻度与重度
  • 有报告称,高位共振峰(formant,声道的共振频率)的变化反映构音精确度下降

作者将自己研究的贡献归纳为三点。

  • 既往研究主要以英语使用者为对象,而本研究分析的是韩语使用者的语音。
  • 从 8 项任务中提取 184 项指标并共同分析。
  • 通过 SHAP 分析考察不同认知状态水平下各声学特征的相对重要性。

方法:从八项发声任务中提取 184 项指标,用四个模型进行分类

论文将研究过程分为四个阶段:采集语音并提取特征,按 K-MMSE 得分划分组别,构建模型,用可解释 AI 进行解释。本文将第一阶段拆分为录音和特征提取,整理为五个步骤。这是在实验和临床研究的常规结构(参与者、任务、测量、模型)之上增加了解释步骤。

图 1. 展示从按 K-MMSE 对 223 名患者分组到 SHAP 解释,利用声学特征分类认知状态的五个步骤。

数据与参与者

参与者为 223 名因怀疑认知衰退而到神经外科门诊就诊的韩国患者。纳入标准如下。

  • 能够理解并遵循任务指示。
  • 没有其他影响语音的神经系统疾病史。
  • 同意参与研究。

一位从业超过 5 年的言语治疗师事先确认了所有参与者。确认项目包括理解指示、可听懂的发音以及完成所有任务。研究获得了庆北大学漆谷医院机构伦理委员会的批准。

第 1 步:按 K-MMSE 得分划分组别

  • 输入:223 名患者的 K-MMSE 得分
  • 处理:按得分区间分为三组,并确定三个二分类问题
  • 产出:重度 72 人,轻度 54 人,正常 97 人
  1. 所有患者均在医务人员观察下接受 K-MMSE。
  2. 依据既有指南和研究,019 分为重度认知衰退,2023 分为轻度认知衰退,24~30 分为无认知衰退(正常)。
  3. 用三组构建三个分类问题:重度对正常、轻度对正常、重度+轻度对正常。

K-MMSE 评估时间和地点定向力、记忆登记、注意与计算、回忆、语言以及空间和视觉认知。作者说明,该得分区间已在针对韩国人的研究中得到验证。

各组之间存在年龄和受教育年限的差异。作者没有控制这些差异。其判断是,在筛查阶段,因衰老导致的认知衰退也可能是痴呆的前兆,将其全部筛出更为合理。各组的平均年龄和平均受教育年限如下。

  • 重度组(72 人):平均 72.44 岁,受教育 7.10 年
  • 轻度组(54 人):平均 71.11 岁,受教育 8.24 年
  • 正常组(97 人):平均 64.80 岁,受教育 10.93 年

第 2 步:录制八项发声任务

  • 输入:223 名参与者
  • 处理:在相同条件下录制 4 项元音任务和 4 项轮替运动(diadochokinetic, DDK)任务
  • 产出:每位参与者 8 项任务的 wav 录音文件

任务如下。

  1. 持续元音发声 /α/、/i/、/u/:每个元音保持 2~3 秒。评估发声稳定性。
  2. 元音延长 /α-α-α/:尽可能长地保持 /α/。评估最长发声时间和呼吸控制。
  3. 轮替运动速率(alternate motion rate, AMR)/puh-puh-puh/、/tuh-tuh-tuh/、/kuh-kuh-kuh/:快速重复同一个音节。评估言语运动功能与协调。
  4. 序列运动速率(sequential motion rate, SMR)/puh-tuh-kuh/:依次发出不同的音节。评估运动计划和序列处理能力。

同时使用两类任务是有原因的。元音任务可以显示发声器官的精细运动控制。DDK 任务要求运动计划、序列处理和时序控制,因此对认知–运动损害敏感。

录音条件固定如下。

  • 环境噪声低于 50 dB
  • 站立,距离任务指示屏幕 55 cm
  • 单指向麦克风置于距口 30 cm 处
  • 采样率 44,100 Hz,以 wav 格式保存
  • 所有录音均由从业超过 5 年的言语治疗师进行

第 3 步:提取声学特征

  • 输入:8 项任务的录音文件
  • 处理:每项任务计算 23 个声学特征
  • 产出:每位参与者 184 项指标(23 个特征 × 8 项任务)

特征分为两类。

  • 音质特征:频率微扰 5 种(local、absolute、RAP、PPQ5、DDP),振幅微扰 6 种(local、localdB、APQ3、APQ5、APQ11、DDA),HNR
  • 韵律特征:发声持续时间、平均 F0、F0 的标准差(stdevF0)、共振峰均值,以及 F1~F4 的均值和中位数

频率微扰的计算方法是:将相邻两个周期长度之差的绝对值全部相加,除以(周期数 − 1),再除以平均周期,最后乘以 100。振幅微扰对振幅进行同样的计算,而不是对周期长度。两者数值越大,表示嗓音越不稳定。

变体指标的计算范围不同。APQ3、APQ5、APQ11 分别在 3 个周期、5 个周期、11 个周期的范围内对振幅变化取平均。DDA 振幅微扰对相邻振幅差之间的差取平均。如后文所示,这个 DDA 振幅微扰成为结果中的关键特征。

HNR 是谐波能量与噪声能量之比取对数后乘以 10 得到的值。数值越高,噪声越少,嗓音越清晰。谐波是 F0 的整数倍频率。如论文中的例子,若 F0 为 100 Hz,则第二谐波为 200 Hz,第三谐波为 300 Hz。

特征计算使用了 Python 3.10.14。作者没有分别考察元音任务和 DDK 任务的特征,而是将它们一起输入同一个模型。这一设计是为了让模型也能学习特征之间的相互作用。

第 4 步:模型训练与评估

  • 输入:三个分类问题和 184 项指标
  • 处理:训练四类模型,并以 PR-AUC 进行比较
  • 产出:每个分类问题中性能最高的一个模型
  1. 准备四类模型:逻辑斯谛线性分类器(LM)、随机森林(RF)、梯度提升(GBM)、深度神经网络(DNN)。
  2. 用自动机器学习(automated machine learning, AutoML)寻找超参数(模型设置值)。
  3. 用 5 折交叉验证(将数据分为五份,轮流验证的方式)减轻过拟合。
  4. 将训练数据与测试数据按 8:2 划分,在测试数据上计算性能。

没有使用 Transformer 或卷积神经网络等较新的结构,是因为数据较少,且特征本身已是数值形式。各分类问题的人数为:重度对正常 72 人和 97 人,轻度对正常 54 人和 97 人,重度+轻度对正常 126 人和 97 人。

将 PR-AUC 定为主要指标,是因为组别规模不均衡且测试数据较少。在这种条件下,只看依赖特定阈值的精确率或召回率中的某一个,判断会不稳定。PR-AUC 是改变阈值、绘制精确率与召回率曲线后得到的曲线下面积。

PR-AUC 有基线。基线是阳性样本数除以总样本数的值,训练良好的模型应高于该值。重度对正常为 72÷(72+97)=0.426。轻度对正常为 54÷(54+97)=0.358。这两个值与论文报告的基线一致。

重度+轻度对正常的计算对不上。用方法部分的人数(126 人和 97 人)计算,126÷223=0.565。然而论文报告的基线为 0.677,而结果部分给出的人数是 151 人和 72 人。151÷223=0.677,因此报告的基线与结果部分的人数相符。论文中的这两个数字哪一个正确,仅凭现有依据无法判断。

第 5 步:用 SHAP 解释重要特征

  • 输入:每个分类问题中 PR-AUC 最高的模型
  • 处理:为每个特征计算 SHAP 值
  • 产出:每个分类问题的前 20 个重要特征

SHAP 是将合作博弈论中的沙普利值(Shapley value)移植到模型解释中的方法。它计算加入某个特征与去掉该特征时预测的差异有多大。在所有可能的特征组合上重复这一计算并取平均。

结果图中,红色表示特征值高,蓝色表示特征值低。SHAP 值为正,表示模型将该特征用于预测目标组;为负,表示用于预测非目标组。作者在每个分类问题中 PR-AUC 最高的模型上分析了前 20 个特征。

结果:仅用声学特征即取得高于基线的性能,但混杂了年龄和受教育程度的差异

组别特征比较:正常组更年轻、受教育年限更长

研究者在查看模型结果之前先比较了各组特征。由于数据不服从正态分布且方差不齐,采用了 Kruskal–Wallis 检验。年龄的 Levene 检验 p = 0.017。

  • 年龄:三组之间差异显著(H = 24.07,p < 0.001)。
  • 受教育年限:差异显著(H = 32.83,p < 0.001)。
  • 性别:差异不显著(χ2 = 2.79,p = 0.248)。

在经 Bonferroni 校正的事后比较中,年龄差异出现在重度对正常(p < 0.001)和轻度对正常(p = 0.003)之间。重度对轻度的 p = 0.956,无差异。受教育年限的情形相同。重度对正常和轻度对正常为 p < 0.001,重度对轻度为 p = 0.532。这意味着只有正常组更年轻、受教育年限更长。

模型性能比较:两个问题中 DNN 最优,一个问题中 RF 最优

三个分类问题的 PR-AUC 按模型整理如下。

模型重度对正常轻度对正常重度+轻度对正常
DNN0.7370.7260.659
RF0.5160.6300.715
GBM0.7160.5830.682
LM0.6320.5970.680

来源:Lee, J. 等,“Exploring Voice Acoustic Features Associated with Cognitive Status in Korean Speakers”,Diagnostics(2024)表 5,仅摘取 PR-AUC 值重新整理。原论文以 CC BY 4.0(https://creativecommons.org/licenses/by/4.0/)许可公开。

按 PR-AUC 衡量,重度对正常和轻度对正常中 DNN 最高,重度+轻度对正常中 RF 最高。换用其他指标,排名会发生变化。在重度对正常中,受试者工作特征曲线下面积(AUC)GBM 为 0.730,高于 DNN 的 0.716。在轻度对正常中,准确率 RF 和 GBM 为 0.800,DNN 为 0.667。

PR-AUC 最高模型的精确率和召回率也值得一看。轻度对正常中的 DNN 召回率为 1.000,精确率为 0.524。重度+轻度对正常中的 RF 精确率为 1.000,召回率为 0.521。论文没有单独讨论这一差异。笔者认为,在筛查工具中,不漏掉患者的召回率很重要,从这个角度看,这两个模型的用途各不相同。

相对基线的提升:轻度对正常中最大

分类问题PR-AUC 第一名模型PR-AUC基线
重度对正常DNN0.7370.426
轻度对正常DNN0.7260.358
重度+轻度对正常RF0.7150.677
图 2. 仅用声学特征的模型,其 PR-AUC 在三个问题中均高于基线,其中轻度对正常的提升幅度最大。

来源:Lee, J. 等,Diagnostics(2024)表 5 及正文数值重新整理。原论文以 CC BY 4.0(https://creativecommons.org/licenses/by/4.0/)许可公开。

作者报告的相对基线提升幅度为:重度对正常 73%,轻度对正常 103%,重度+轻度对正常 6%。计算可得 0.737÷0.426=1.73,0.726÷0.358=2.03,0.715÷0.677=1.06。最后一个问题的基线本身已较高,因此提升幅度较小。

作者自己写道,三个问题之间的性能差异不大。与既往研究的比较也须谨慎。一项使用 Framingham Heart Study 数据的研究同时纳入声学、语言和人口统计学变量,报告 AUC 为 0.942。另一项研究报告,仅用人口统计学变量时 AUC 为 0.773,加入声学特征后升至 0.812。本文只使用声学特征,并以 PR-AUC 为主要指标,因此很难直接比较这些数字。

重要声学特征:/i/ 的 DDA 振幅微扰与 /puh-tuh-kuh/ 的 F0 标准差

各分类问题的 SHAP 前列特征如下。

重度对正常(DNN)

  • 第 1 位是 /i/ 任务的 DDA 振幅微扰。数值越高,越预测为正常。
  • /tuh-tuh-tuh/ 任务的 F3 均值较高时,预测为重度。
  • /α-α-α/ 任务的 DDA 振幅微扰较高时,预测为正常。

轻度对正常(DNN)

  • 第 1 位同样是 /i/ 任务的 DDA 振幅微扰。数值越高,越预测为正常。
  • /kuh-kuh-kuh/、/α/、/u/ 任务的振幅微扰类特征影响也较大。
  • /u/ 任务的 APQ5 振幅微扰越高,越预测为轻度。

重度+轻度对正常(RF)

  • 第 1 位是 /puh-tuh-kuh/ 任务的 stdevF0。数值低时预测为认知衰退,数值高时预测为正常。
  • /i/ 任务的 DDA 振幅微扰数值越高,越预测为认知衰退。
  • /puh-tuh-kuh/ 任务的 DDP 频率微扰数值越高,越预测为认知衰退。
  • /i/ 和 /u/ 任务的 F2 中位数、/kuh-kuh-kuh/ 任务的 F4 中位数,大体上数值越高,越预测为认知衰退。
  • /tuh-tuh-tuh/ 和 /kuh-kuh-kuh/ 任务的 APQ3 振幅微扰数值越高,越预测为正常。

作者注意到,/i/ 任务的 DDA 振幅微扰在多个分类问题中都很重要。/i/ 元音需要精确控制舌的位置并保持狭窄的声道。/puh-tuh-kuh/ 需要在唇音、齿龈音、软腭音之间快速转换,认知–运动负担较大。作者解释说,stdevF0 的重要性可能反映了这种负担。

笔者认为有一点需要指出。/i/ 任务的 DDA 振幅微扰在三个问题中都很重要,但影响方向因问题而异。两个 DNN 模型是数值越高越预测为正常,而 RF 是数值越高越预测为认知衰退。振幅微扰值高意味着嗓音不稳定,也有既往研究指出年龄越大振幅微扰越大。因此,要把这一特征用作认知状态的指标,必须先重新确认其方向。

意义与局限

带来了什么改变

这篇论文所做的新工作如下。

  • 利用 223 名韩语使用者的语音尝试了认知状态分类。
  • 从元音任务和 DDK 任务共 8 项任务中提取 184 项指标,一并输入同一个模型。
  • 在不使用人口统计学变量或语言内容的情况下,仅凭声学特征,三个问题的 PR-AUC 均高于基线。但提升幅度因问题而异,在重度+轻度对正常中仅为 6%。作者也指出,组间年龄和受教育程度的差异可能混入了这一结果。
  • 将重度与轻度分开,按分类问题比较了重要特征。
  • 以任务与特征的组合为单位报告了重要性。代表性组合是 /i/ 的 DDA 振幅微扰和 /puh-tuh-kuh/ 的 stdevF0。

对从业者的价值

对于规划筛查服务的从业者,这篇论文提供了具体的录音流程。8 项任务的内容、麦克风距离 30 cm、环境噪声低于 50 dB、采样率 44,100 Hz 都有明确记载。自行采集数据时若完全遵循这些条件,结果就可以与本文进行比较。

评估方式也值得参考。组别规模不均衡时,仅凭准确率难以判断。同时报告 PR-AUC 和基线的做法,在评估其他筛查模型时也可直接使用。

对研究者的价值

对研究者而言,多了一份待验证的假设清单。哪项任务的哪个特征与认知状态相关,候选范围已经缩小。作者提出的后续研究方向如下。

  • 年龄匹配的组别以及按受教育水平分层的分析
  • 对同一个人进行多年追踪的纵向研究
  • 对人口统计学变量进行统计校正的分析
  • 比较多种语言,确认语音指标是否因语言而异的研究

论文自述的局限

论文自己指出的局限有六点。

  • 正常组更年轻、受教育年限更长。重要特征可能反映的是衰老或教育效应,而不是认知衰退。
  • 没有对各特征的组间差异进行统计检验。
  • 没有将性能与现有筛查方法比较。
  • 完成全部 8 项任务所需的时间可能给患者造成负担。
  • 需要将录音和分析的技术要求标准化,并在多种临床环境中确认测量的信度和可重复性。
  • 样本为 223 人,按性别差异等细分分析需要更大规模的研究。

作者因此写道,应将结果理解为概念验证(proof-of-concept),而不是确定的生物标志物。数据属于正在进行的研究的一部分,因此未公开。

笔者认为的应用条件

以下内容并非论文所述,而是笔者着眼于实际应用补充的条件。

  • 必须匹配对照组的年龄和受教育年限。不匹配的话,就无法确认模型区分的究竟是认知状态,还是年轻与年长的嗓音。
  • 必须确认测试数据的规模。论文没有单独写明各问题的测试数据人数。由于训练与测试数据按 8:2 划分,测试数据只是各问题人数的一小部分。在这种规模下,性能数值容易波动。
  • 必须先确认重要特征的方向在各分类问题中是否一致。像 /i/ 的 DDA 振幅微扰这样方向会变化的特征,很难用作筛查规则。
  • 本论文没有与睡眠或视线等其他数据进行比较。论文只涉及与脑影像的对比。语音是否比其他数据更便宜、更准确,需要对同一批受试者同时采集多种数据,比较成本和性能后才能判断。
  • 若要发展为家用筛查工具,录音环境就会不同。本研究在噪声低于 50 dB 的受控房间内录音,因此在日常环境中能否取得同样的性能,需要另行确认。

马上可以做的事

用自己的数据复现这篇论文的流程,第一步有以下三件事。

  1. 先为每个分类问题计算 PR-AUC 基线。将阳性人数除以总人数即可。以本文的重度对正常为例,为 72÷(72+97)=0.426。报告模型性能时,始终将其与该基线并列写出。
  2. 划分组别后,立即比较年龄、受教育年限和性别。像论文那样使用 Kruskal–Wallis 检验和 Bonferroni 校正的事后比较,就能马上确认是否只有正常组更年轻。
  3. 如果难以一次完成 8 项任务,可以先录制 /i/ 持续发声和 /puh-tuh-kuh/ 重复这两项任务。遵守麦克风 30 cm、噪声低于 50 dB、44,100 Hz 的条件,确认 DDA 振幅微扰和 stdevF0 在各组之间朝哪个方向不同。

关键词

相关文章