基层医疗中,日常就诊对话就能筛查认知功能受损?一项基于语音声学分析的机器学习研究带来新线索
发布时间:2026-06-25   

认知功能受损(CI)在老年人群中较为常见,但在基层医疗中常因时间和资源限制而未被及时识别。现有简短认知评估工具,如蒙特利尔认知评估量表(MoCA),虽可用于筛查,但需在常规门诊中额外实施;尽管如此,基层医疗中的常规认知筛查仍未普遍开展。

语音特征被认为可能反映个体的认知状态。既往研究多依赖图片描述等结构化任务采集语音,通常需要专门实施测试并占用额外时间,也难以完全还原真实就诊场景。近日发表的一项诊断性研究尝试直接分析基层医疗常规就诊中的医患自然对话,探索能否利用语音声学特征和机器学习(ML)模型,对既往未被诊断的 CI 进行被动筛查。

研究设计

纳入标准为年龄 ≥55 岁、能够使用英语交流、正在接受常规基层医疗服务,且既往病历中无轻度认知障碍痴呆或相关疾病诊断记录的患者。研究共纳入 966 例受试者,其中纽约开发队列 787 例,芝加哥外部验证队列 179 例;530 例(55%)为女性,平均年龄为 67.2±8.1 岁。依据年龄和受教育程度校正后的蒙特利尔认知评估量表(MoCA)评分判定,21%的受试者存在既往未被诊断的认知功能受损(CI)。


研究人员在常规就诊期间使用便携式录音设备采集医患对话,并将录音划分为多个互不重叠的30秒语音片段。随后,研究者采用 Whisper、HuBERT、wav2vec 2.0等语音基础模型,以及扩展版日内瓦最简声学参数集(eGeMAPS)和韵律特征集,提取声学特征。


研究以 MoCA 作为CI的参照标准:将原始MoCA评分转换为年龄和受教育程度校正后的 Z 评分后,低于常模均值至少1.0个标准差者被定义为存在CI。研究采用极端梯度提升(XGBoost)分类器,先对单个语音片段进行预测,再整合为个体层面的CI分类结果。主要评价指标为受试者工作特征(ROC)曲线下面积(AUROC)和认知功能受损类别的最大F1分数[Fmax(CI)]。


图片

图 1 语音预处理、特征提取及分类流程示意图

医患对话录音先以 30 秒为窗口进行分段,再提取声学特征。各语音片段的 Whisper 衍生声学特征被输入极端梯度提升(XGBoost)分类器,生成片段水平预测;随后对各片段的预测结果进行聚合,得到受试者层面的认知功能受损分类结果。图中绿色和蓝色路径表示患者语音的处理流程,其中可能混入医生语音(红色)或无关噪声(黄色)。



研究结果

在开发队列中,基于 Whisper 提取的声学特征表现最佳。对未经处理的医患原始对话进行分析时,模型的平均 AUROC 为 0.733(95% CI:0.714~0.752),Fmax(CI)为 0.502(95% CI:0.471~0.533)。总体而言,基于深度神经网络的 Whisper、HuBERT 和 wav2vec 2.0 特征,其分类表现优于 eGeMAPS 和韵律特征等传统声学特征。


图片

图 2 开发队列中不同声学特征模型的分类性能(n=787)

图 A 和图 B 分别展示开发队列中,采用 6 种特征提取方法并进行 5 折交叉验证后获得的平均受试者工作特征曲线下面积(AUROC)和最大 F1 分数(Fmax)。模型在 3 种音频版本上训练:未经处理的医患语音(患者+基层医疗医生[PCP],深蓝色)、经降噪处理的医患语音(中蓝色)以及经降噪处理的仅患者语音(浅蓝色)。总体而言,基于深度神经网络的特征,包括 Whisper、HuBERT 和 wav2vec 2.0(W2V2),优于传统声学特征,包括韵律特征和扩展版日内瓦最简声学参数集(eGeMAPS)。Whisper 嵌入表征在各类音频条件下均表现最佳。


外部验证中,基于 Whisper 的模型表现出较好的泛化能力。经语音活动检测(VAD)预处理后,模型在芝加哥验证队列中的 AUROC 为 0.727(95% CI:0.714~0.740);在未经处理的原始录音中,Fmax(CI)为 0.459(95% CI:0.441~0.477)。相比之下,多数其他模型在外部数据集中的分类性能有所下降。


图片

图 3 外部验证队列中不同声学特征模型的分类性能(n=179)

图 A 和图 B 分别展示在开发队列训练、外部验证队列测试的模型,其平均 AUROC 和最大 F1 分数。模型在 3 种音频版本上进行评估:未经处理的医患语音(患者+PCP,深蓝色)、经降噪处理的医患语音(中蓝色)以及经降噪处理的仅患者语音(浅蓝色)。基于 Whisper 的模型显示出最强的泛化能力,在外部验证中保持了与开发队列相近的分类性能;基于仅患者语音的韵律特征模型也表现出相对稳定的外部验证性能。


研究者进一步评估了模型的筛查表现,并在假定基层医疗中未诊断CI的比例约为 20%的条件下设定筛查阈值,使阳性预测值(PPV)接近 30%。以VAD 处理后的Whisper模型作为筛查算法时,开发队列的敏感度为83.4%,特异度为 44.4%,PPV 为 28.2%;在外部验证队列中,敏感度为68.2%(95% CI:61.8%~74.6%),特异度为 63.6%(95% CI:59.8%~67.4%),PPV 为 30.4%(95% CI:28.7%~32.1%)。


值得注意的是,仅基于年龄和性别训练的模型在开发队列和外部验证队列中的表现接近随机水平,提示仅凭这两项人口学变量难以解释声学模型的区分表现。对经源分离处理后的患者单人语音韵律特征模型进行Shapley加性解释(SHAP)分析显示,停顿时长变异性增大和无声段能量均值升高,与更高的 CI 预测概率相关;较高的基频(F0)、有声率及有声音段能量相关特征,则更倾向于使模型判定为认知功能正常。

图片

图 4 外部验证队列中韵律特征模型的 Shapley 加性解释(SHAP)分析

该图为基于经降噪处理的仅患者语音所提取的韵律特征、训练 XGBoost 分类器后进行的 SHAP 特征重要性分析。横条表示各特征的平均绝对 SHAP 值,即其对模型预测的平均贡献。棕褐色条表示与认知功能受损预测正相关的特征,包括停顿时长变异性和无声段能量均值;蓝色条表示与认知功能正常分类正相关的特征,包括基频相关指标、有声率、有声音段能量相关指标及无声—停顿比。模型提示,语音变异性增加、发声控制减弱及韵律效率下降,可能与认知功能受损相关。



讨论

该研究表明,常规基层医疗就诊中的医患自然对话,可能包含可用于识别CI的声学信息。与需要专门安排的认知测试不同,该方法的分析流程不依赖文字转写或额外设计的语言任务,而是从真实诊疗交流中提取语音特征,为被动筛查提供了新的技术路径。


在该研究设定下,该模型更适合作为初筛工具,用于提示可能需要进一步接受 MoCA、简易精神状态检查量表(MMSE)等正式认知筛查,或更全面认知评估的患者,而不宜直接用于诊断。外部验证中,30.4%的 PPV 意味着每10名被模型标记为高风险的患者中,约有3名符合研究所采用的CI参照标准。更合理的应用场景是将算法结果作为提示信号,协助基层医疗团队识别需要进一步接受正式认知评估的患者。


针对模型的作用机制,Meade教授和 Botha教授在同期述评中指出,当录音同时包含患者和医生语音时,模型表现优于仅分析患者语音;这除可能反映轮流发言等“对话完整性”外,也可能提示模型捕捉到了医生在与认知功能受损患者交流时可能出现的较慢语速、较简单句法、较高音调或更夸张韵律等沟通表现。后续研究应区分患者自身声学特征与医生沟通方式变化对模型表现的贡献,例如可单独分析医生语音,并开展相应的模型解释分析,以明确模型实际识别的信号来源。


Meade教授和Botha教授还强调,语音筛查工具的临床转化不能只看模型性能。假阳性结果可能导致进一步评估,部分后续检查还可能涉及侵入性检查、遗传信息或生物标志物结果告知,从而增加患者及家属的心理负担,并加重专科评估资源压力;与此同时,基于语音的算法及以MoCA作为参照标准的评价方式,均可能受到种族、族裔、语言能力和文化背景的影响。因此,未来研究除评价该工具的检出收益外,还应采用更全面、文化适应性更强的参照标准,并前瞻性评估其实际获益与潜在伤害。


需要注意的是,研究仅在两家关联医疗机构采用统一方案收集数据,模型也未显式分析词汇内容;此外,除年龄和受教育程度外,英语语言能力及其他文化因素也可能影响MoCA表现。因此,仍需在更大、更多样且多语种的人群中开展进一步验证。


总体而言,这项研究为在常规基层医疗场景中开展非侵入性、低额外负担的 CI 被动筛查提供了初步证据。语音声学分析能否进一步转化为CI早期识别的实际改善,并在不同临床人群中保持稳定且公平的表现,仍需在更大规模、多语言和更多临床场景中进一步验证。


参考文献:

[1] COLONEL JT, BECKER J, CHAN L, et al. Acoustic analysis of primary care patient-clinician conversations to screen for cognitive impairment. JAMA Neurology, 2026-06-15. DOI: 10.1001/jamaneurol.2026.1868.

[2] MEADE G, BOTHA H. Clinical conversations as a window into cognitive impairment. JAMA Neurology, 2026-06-15. DOI: 10.1001/jamaneurol.2026.1863.

(本网站所有内容,凡注明来源为"医脉通",版权均归医脉通所有,未经授权,任何媒体、网站或个人不得转载,否则将追究法律责任,授权转载时须注明"来源:医脉通"。本网注明来源为其他媒体的内容为转载,转载仅作观点分享,版权归原作者所有,如有侵犯版权,请及时联系我们。)
1
收藏
添加表情
全部评论
我要投稿
发表评论
扫码分享

微信扫码分享

回到顶部