医脉通导读
本项系统综述提示,声学特征及词汇-语义特征会随躁狂、精神病性或抑郁状态而变化。例如,躁狂状态下可观察到言语迫促、离题、语法错误和词语重复;抑郁状态则更多表现为人称代词(尤其是第一人称代词)使用增加、言语流畅性下降和言语量减少。
然而,目前多数研究只能判断
基于现有证据,语音标志物有潜力成为连续评估的辅助线索,但目前尚不能将其用于判断患者是否即将复发、治疗反应如何,或是否已经进入混合状态/发生状态变化。
双相障碍患者的心境变化可发生在两次复诊之间,显著加重之前难以被及时察觉。轻躁狂、抑郁、非情感性精神病和物质诱发心境发作的临床表现有时相互重叠,早期识别和鉴别诊断因此更具挑战。
语音之所以值得关注,是因为它天然就是精神科评估的一部分。医生会常规关注患者的语速快慢、音量高低、停顿与否、话题是否跳跃、内容是否连贯,而自然语言处理和自动语音分析则可以将这些临床观察转化为可重复、可量化、可

在这一背景下,加拿大麦吉尔大学Farida Zaher及其
现有证据特点
初筛867项研究后,综述最终纳入43项研究,涉及双相障碍患者与健康对照、
纳入研究呈现出以下特点:
样本规模差异较大,双相障碍参与者从4例到141例不等;
仅14项研究包含纵向成分,语音数据采集时间从2天到16个月不等,其余多为横断面研究;
28项纳入躁狂或轻躁狂状态,21项纳入抑郁状态,27项纳入心境平稳状态,9项纳入混合状态;
25项研究使用分类算法,其中19项使用声学特征,6项使用词汇-语义信息。
从研究趋势看,早期文献更多关注句法、动词、代词等语言学特征;2015年以后,声学指标和机器学习的比重明显上升,研究问题也逐渐转向「能否用自动化语音特征映射心境状态」。
成果:不同心境状态的语音画像不同
综述显示,一些研究已经可以通过语音特征,把双相障碍患者与健康个体、精神分裂症患者或抑郁症患者区分开来。语言内容方面,相关线索包括语义连贯性下降、表达角度更分散、说话更多,以及语义流畅性变化等;声音特征方面,研究最多的是停顿、语速、音高等,其次是MFCC等反映声音频谱特征的指标。
还有一个值得注意的现象:在不少语言指标上,双相障碍患者的异常程度似乎介于健康个体和精神分裂症患者之间。也就是说,这些语音和语言变化未必只是「情绪好不好」的反映,还可能与认知功能、思维组织方式和疾病表现有关。当然,这种「介于两者之间」的特点还不能直接作为诊断工具。
在双相障碍内部,不同心境状态的语音画像也并不相同:
躁狂状态:更容易出现言语迫促、离题、语法错误、词语重复;非声学指标中,动作动词、权力和成就相关词、形容词和具体名词等也被部分研究捕捉到。
抑郁状态:更常见个人代词或第一人称代词使用增加、修饰副词增加、言语流畅性下降、言语量减少;声学上可表现为停顿更长、语速更慢、言语输出减少等。
混合状态:已有研究尝试用声学特征区分躁狂、混合和抑郁状态,但整体证据仍有限,尚不足以支持临床诊断层面的直接应用。
分类结果也提示同一个问题:语音里确实有一些可被算法捕捉到的线索,但这些线索还不够稳定,也还没有充分证明能推广到不同样本和场景。综述中,不同研究的表现差异较大:区分BD与其他组别时,结果从AUC 0.58到约73%准确率不等;区分BD内部不同状态时,AUC从0.63到0.89不等。换言之,语音标志物值得继续研究,但目前还不能作为临床使用依据。
硬伤:尚不能预测接下来的状态变化
这篇综述真正需要临床医生留意的,不是「语音AI已经能诊断双相障碍」,而在于目前语音分析最多只能帮助判断患者当下更接近哪种状态,还不能提前预测下一次心境转换。
具体而言,很多研究做的是「看现在」,即根据语音特征判断患者当前更接近躁狂、抑郁还是心境平稳。少数研究虽然反复采集了语音,也报告过较高的当前状态分类准确率,例如区分心境平稳、抑郁、躁狂/混合状态时约为71%;但这并不等于能够「提前预警」。到目前为止,尚无研究证明语音特征可以预测患者接下来是否会从一种心境状态转入另一种状态。
因此,现阶段语音分析更适合作为临床评估的辅助线索,而不是复发或状态转换的预警工具。只有未来前瞻性研究证明它能提前识别复发或转换风险,才可能真正进入预警和干预流程。
临床解读
语音标志物的吸引力在于采集门槛低、侵入性小,并且可以在常规临床互动、电话、社交对话或自然场景中反复获得。相比地理位置、步数、通话记录等间接指标,语音更贴近医生实际评估躁狂和抑郁时会观察的表现。
对临床读者而言,这项综述的价值不在于提供一个现成工具,而在于提醒我们更系统地看待言语变化:
首先,语音变化本身值得更系统地记录和描述。语速、停顿、音高、言语量、代词使用、语义连贯性等,可能帮助医生更细致地描述心境状态,而不是只依赖单次访谈中的主观描述。
其次,连续、个体内比较可能比单次横断面判断更有价值。未来若能在同一患者身上反复采样,或许更有机会捕捉门诊间隔期内悄然出现的轻躁狂或混合特征。
最后,现阶段不宜将语音分析表述为可直接用于临床诊断的工具。复发预测、治疗反应监测、混合发作或状态转换诊断,当前证据均不足以支持临床实用化。
还有一个容易被忽略但很现实的证据缺口:本项综述纳入的研究中,没有研究加入质性成分来了解双相障碍亲历者对语音采集方案、设备使用、隐私和临床整合的接受度与偏好。未来即便算法性能提高,患者是否愿意被采集、如何同意、数据如何保护,仍会决定这类工具能否真正进入日常诊疗。
局限与下一步
这项综述也有明确限制。它只纳入已发表的英文研究,且研究对象限于成人;不同研究在语音如何采集、分析哪些指标、采用什么算法、如何报告结果等方面差异很大,因此无法把结果合并起来做定量分析。
现有研究本身也还不够成熟。很多模型缺少外部验证,变量选择缺少统一的理论或心理测量学依据;样本代表性也有限,年龄、教育、母语、移民身份、物质使用、治疗暴露等可能影响语音表现的因素,在多数研究中还没有被充分考虑。
还有一个更贴近临床的问题:现有研究经常将双相障碍与精神分裂症作比较,但很少直接比较双相障碍与ADHD、PTSD、边缘型人格障碍或物质诱发心境状态等人群。换言之,语音标志物能否帮助医生处理真实门诊中的复杂鉴别诊断,目前还缺少证据。
此外,不同研究使用的语音任务也不一样:有的让患者描述图片,有的分析自由谈话、手机通话或临床访谈。这些差异都会让研究结果更难直接比较。
结论
总的来看,双相障碍患者的语音和语言中,确实可以观察到一些与当前状态相关的信号。躁狂、抑郁、混合状态之间,以及双相障碍与健康对照、精神分裂症或抑郁症等对照组之间,都可能在声学特征和词汇-语义特征上有所不同。
然而,以上发现离临床应用还有距离。现阶段,语音标志物还不能用来判断患者是否即将复发、治疗反应如何,或是否已经进入混合状态/发生状态变化。接下来更重要的是先做好基础研究:开展纵向和跨语言研究,进行外部验证,建立可共享的语音数据库,并在采集流程、隐私保护和知情同意方面形成统一规范。
2021-02-16

文献索引:Zaher F, Ahrens J, Raucher-Chéné D, et al. Speech and Language Markers of Bipolar Disorder: Challenges and Opportunities. Bipolar Disord. 2026;28:e70119. doi:10.1111/bdi.70119.
点击「阅读原文」可查看及检索历史文章。
