Debanjan Ghosh,边缘人工智能业务AI/ML软件首席工程师
Yakov Shkolnikov
2026年3月31日
语音正悄然成为越来越多应用的用户界面。在家里,您可以与智能音箱、可穿戴设备对话;工作中,您可与工业设备、医疗设备交互;甚至在通勤途中,您还能与车载系统交流。设计得当的语音交互浑然天成、自然流畅。但现实却不尽人意,我们常常需要反复下达指令,只因系统难以领会我们的意图。ADI团队另辟蹊径,从全新视角探寻破局之道:关键词的选择。
语音系统依托关键词识别(KWS)算法,在连续音频流中检测特定词汇或短语。这方面的研究大多聚焦于优化KWS模型,通过模型压缩、端侧学习等手段,让模型更小巧、响应更迅捷、适配性更强。ADI自研模型近期在小型化与高精度结合方面取得了突破性进展。而ADI团队试图解答一个长期被视而不见的问题:
我们能否从源头筛选出最适配的关键词?“更优”的关键词在嘈杂环境中是否能被稳定识别?
为何关键词的选择至关重要?
假设有一套用于办理患者入院的语音控制系统。系统指令可设为“admit patient”,但若换成“register patient”,系统识别难度会不会更低?尤其是在医院这种嘈杂环境下。
KWS算法必须在资源受限的硬件上运行,同时对这类指令做出即时、正确的响应。由于响应速度至关重要,且无法容忍网络延迟,算法必须在设备本地执行。这种本地执行方式还能提升安全性与隐私性。
时至今日,相关研究主要聚焦于本地执行技术,例如模型量化与剪枝,且已卓有成效。然而,一旦所选关键词本身难以检测,即便模型效率再高,识别效果也会大打折扣,在嘈杂环境中更是雪上加霜。我们认为,系统识别的成败或许取决于关键词本身的结构,例如词语的语素构成。
语素是词语中承载独立语义的最小单位,比如“redo”中的“re”,或“running”中的“ing”。我们大胆假设:选用包含稀有语素的关键词(如“register”中的“gister”),识别效果将远胜于包含常用语素的关键词。更进一步,我们能否为这类KWS系统设计一套优化的关键词组合?
ADI的解决办法:一套实用、基于AI的智能关键词选择方案
我们团队采用了两阶段方法:
-
基于文本的分析
这一研究思路主要是为了检验语素的信息熵大小,即语素在词语中的可预测程度。借助OpenAI的GPT模型,我们生成了一系列医疗保健领域的专用关键词及其同义词,并为每个词语构建了不少于二十个样句。随后,大语言模型(LLM)将每个词语拆分为多个语素,并通过熵值指标对各个语素进行评估:
- 加权熵:通过唯一性分值反映语素的罕见程度。
- 联合熵: 衡量这些语素在同一关键词中共同出现的稀有程度。联合熵数值越高,代表关键词越不常见。
研究素材取自高频对话语料库1,我们从中提取语句并将词语拆分为语素。随后,根据识别出的各语素出现频率,计算其对应的熵值。
-
基于语音的分析
这一阶段明确纳入物理智能因素,包括环境噪声、信号失真及感知限制等。这些因素对关键词在真实场景中的可检测性影响极大,但在纯模型评估中常被忽视。虽然熵值可为关键词选择提供重要参考,但在真实场景中评估关键词的可识别程度同样非常重要。为此,我们生成了包含目标关键词及其同义词的语句语音样本,具体流程如下:
- 借助ChatterboxTTS文本转语音工具,把样句转换为音频,每条样句均含候选关键词。
- 利用PASCAL CHiME数据集,加入不同信噪比(SNR)的背景噪声,高度还原真实应用环境。
- 采用DeepFilterNet模型对样本进行降噪处理。
- 接下来,运用自动语音识别模型Whisper,将降噪后的音频重新转回文本语句。
- 最后,将原始语句与新生成的语句均转换为文本嵌入向量(相似文本的嵌入相似度更高),并对比二者相似度。某一关键词的相似度得分越高,代表其在嘈杂环境中越易于识别。为保证更优的泛化效果,我们统计并给出单个候选关键词在所有语句中的平均相似度。
这套融合语言学与音频研究的两阶段跨学科流程,为关键词评估与选择提供了系统化、可复现的框架。由该方法判定为相似度高的词语,在嘈杂环境中自然具备更强的可检测性。
研究发现
研究表明,熵值更高的词语被KWS算法准确检测的概率通常也更高。结果证实,选择恰当的关键词可显著提升语音控制系统的可靠性,尤其在嘈杂环境中效果更为突出。例如:“register patient”的识别效果优于“admit patient”;“deliver medication”的表现胜于“give drug”。上述结论在文本与音频评估中均得到印证,最优情况下,即便在-10 dB信噪比的环境下,语音相似度仍可超过0.9。这意味着,即便噪声强度接近语音信号的十倍,所选关键词依然能保持极高的识别有效性。
未来展望
本研究提供了一套实用框架,可通过优化关键词的选择,进一步提升KWS模型的性能。这套流程能够加速现有模型级用例的适配与开发工作。通过综合考量语言特性与声学特征、感知机制及环境噪声之间的相互作用,关键词的选择已成为边缘侧更广泛物理智能技术体系中的一个重要环节。未来工作将把这套方法拓展至更多行业领域(包括车载系统),并覆盖英语以外的其他语言。与领域专家开展合作,有助于让关键词的选择更加贴合真实应用场景。这种适配性有助于确保语音系统在部署环境中始终保持精准高效、自然流畅、稳定可靠。
来源:
1Switchboard Dialog Act Corpus语料库、Cornell Movie-Dialogs Corpus语料库、Reddit Dialog Corpus语料库