流式语音识别

义项:语音识别技术
流式语音识别

流式语音识别是自动语音识别的一种工作方式,指一边接收语音、一边输出识别结果,而不是等整段语音结束再统一转写[1]。它使识别结果能够随说话过程动态更新,从而压缩人机交互中等待转写的时间[1]。与一次性看到完整音频的非流式识别相比,流式识别可用的上下文更少,通常需要在识别延迟与识别准确率之间做取舍[2]。该技术广泛用于实时字幕、语音输入法、在线会议记录与智能语音助手等场景[3]。

目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

流式语音识别是自动语音识别(ASR)中按增量方式工作的技术路线,其基本特征是音频输入与文本输出同步进行,模型在只收到部分音频时就给出识别结果,而不必等待整句话说完[1]。由于输出随语音持续更新,识别结果在说话过程中会动态变化,可能先给出中间结果、再在后续上下文到位后修正[4]。

判断一个语音模型能否流式处理,关键看两点:编码器是否具有因果性或按块处理,即只依赖已经到达的音频;解码是否增量式,即每收到一小段音频就输出一部分结果[5]。与之相对,非流式识别会利用整段语音的完整上下文生成结果,通常准确率更高,但需要在语音结束后再等待一段时间[6]。

原理

从信号处理角度看,流式识别的输入是连续音频流。系统先对音频做分帧、加窗与频域变换,提取梅尔频率倒谱系数等声学特征[7]。特征随后送入声学模型,由声学模型计算各时刻对应音素或字符的概率分布,再由语言模型结合语言学知识挑选更合理的词序列,最后由解码器输出文本[7]。

在端到端模型中,流式能力主要靠编码器与解码器的改造来实现。常见做法有两种:一是采用因果或受块掩码约束的自注意力与因果卷积,使编码器无法访问未来帧;二是采用分块处理,每个输入块由固定数量的过去帧、当前帧与少量未来帧组成,注意力只在一个块内交互[8]。注意力模型的流式化还可借助单调分块注意力(MoChA)等机制,通过选择概率决定何时触发一次读取并输出下一个词,从而让文本与音频同步对齐[9]。

直接支持流式解码的两类结构是连接时序分类(CTC)与循环神经网络换能器(RNN-T)。CTC 通过引入空白标签解决输入输出长度不一致的问题,但其输出存在滞后,需要额外的正则化手段促使非空白标记更早输出[8]。RNN-T 交替处理输入样本并流式输出符号,使用反馈循环把已预测符号回传给模型以预测下一个符号,且解码时只需在一个神经网络内做束搜索,模型规模可做得较小[10]。

说话起止的判定也是流式系统的一环。系统需要判断用户何时说完并关闭麦克风,常用方式包括基于尾部静音时长的静态端点检测、轻量神经网络端点检测,以及在识别模型内部直接预测句尾标记[11]。端点检测的参数设置会直接影响用户感受到的响应快慢[11]。

发展历程

语音识别自 20 世纪 50 年代起进入研究视野,早期系统以孤立词识别为主,1952 年贝尔实验室的 Audrey 系统仅能识别 10 个数字[12]。20 世纪 70 至 80 年代,隐马尔可夫模型(HMM)理论成熟并成为主流建模框架,其后长时间内语音识别以 HMM 为基础框架,但该类系统由声学模型、发音词典与语言模型等多个独立模块串联,各模块需分别优化,流程复杂[12]。

深度学习的引入改变了识别系统的结构。2006 年之后,深度神经网络被用于估计 HMM 状态的发射概率,形成 DNN-HMM 混合系统,取代高斯混合模型并显著提升性能;随后循环神经网络及其变体也被用于序列建模[13]。

端到端模型进一步简化了流程,把音频到文本的映射放入单一神经网络。2006 年提出的连接时序分类(CTC)无需帧级强制对齐即可训练序列标注任务;2014 年前后,基于 CTC 与循环网络的 Deep Speech 系统验证了全端到端识别的可行性[13]。以 RNN-T 为代表的换能器结构因为能够持续处理输入并流式输出符号,成为流式场景的重要选择,并已在生产系统中部署[14]。

基于注意力机制的编码器-解码器模型在非流式任务上表现更好,但需要先观察完整音频才能生成输出[10]。为使其支持流式识别,研究者提出了时间受限自注意力、单调分块注意力与触发式注意力等方法[14]。Strimer 与 Conformer 结合卷积与自注意力,其流式版本采用因果卷积与分块注意力设计,成为工业界常用的流式结构[15]。此后,统一流式与非流式的单一模型成为研究方向,通过动态右上下文与分块注意力掩码,让同一个模型兼顾两种工作模式[16]。

应用

流式识别主要用于对响应速度敏感、需要边说话边出字的场景,包括在线会议的实时字幕、同声传译与直播字幕等[3]。在移动设备上,它被用于数字助理、语音搜索与语音输入法,使词或字一说出口就显示在屏幕上[17]。

由于流式模型内存占用较紧凑,它比非流式模型更适合部署在手机、智能音箱等终端设备上完成本地识别,从而减少网络通信带来的延迟[6]。部分实现将端点检测与轮次判断直接内置于识别模型中,用于语音交互类应用[5]。

在一些产品设计中,同一会话会同时使用流式与非流式两条解码路径:先以低延迟路径输出部分识别结果并即时展示,再以高延迟路径给出最终结果,从而兼顾即时反馈与最终准确率[17]。

局限

流式识别最突出的限制是延迟与准确率之间的取舍。设计流式系统时通常要在二者之间做平衡:减小块大小或缩短注意力范围可以降低延迟,但可供模型使用的上下文随之减少,识别准确率会下降[2]。相关实验显示,使用因果变换器编码器替代非因果编码器会带来约 2 个 BLEU 分的损失,流式与非流式模型之间约有 10% 的相对性能差距[2]。

由于只能利用有限的未来上下文,流式识别在识别罕见词、专有名词、人名、邮箱地址等依赖前后文的内容时错误率相对偏高[5]。CTC 类结构还存在非空白标记输出滞后的问题,需要通过损失函数中的惩罚项或裁剪尾部帧等方式加以缓解,而这些方法同样是在延迟与准确率之间做调整[8]。

增加未来上下文可以提升准确率,但会直接抬高延迟。例如在级联编码器结构中,第二遍解码会滞后实时约 900 毫秒以获取右上下文信息,这一滞后量本身构成了用户可感知的延迟来源[18]。研究还表明,模型参数量、输入块大小等指标与用户在设备上实际感受到的延迟并不总是强相关,标记输出时机与端点检测行为对感知延迟的影响更大[11]。

端点检测本身也存在难以两全的问题:依靠静音阈值判断说话结束,等待时间过短会在用户思考停顿时切断句子,过长则会增加延迟,因此需要按场景调节阈值[19]。此外,把连续音频切成独立片段分别送入识别,会破坏上下文的连续性[5]。

参见

  • 自动语音识别 —— 流式语音识别是自动语音识别中的一类增量式工作方式。

  • 连接时序分类 —— 可直接用于流式解码的端到端建模方法,通过空白标签解决输入输出长度不一致问题。

  • 循环神经网络换能器 —— 能够持续处理输入并流式输出符号的端到端结构。

  • 隐马尔可夫模型 —— 深度学习普及前语音识别的主流建模框架。

  • 注意力机制 —— 编码器-解码器识别模型的核心机制,经改造后可支持流式解码。

  • 梅尔频率倒谱系数 —— 流式识别前端常用的声学特征之一。

参考资料

  1. 端到端流式语音识别研究综述 . cnki.com.cn [引用日期2026-10-08]
  2. rabatin24_interspeech(PDF) . isca-archive.org [引用日期2026-10-08]
  3. ieee.org 上的网页 . ieee.org [引用日期2026-10-08]
  4. 实时语音转写API的核心参数与配置策略_讯飞开放平台 . xfyun.cn [引用日期2026-10-08]
  5. book(PDF) . github.com [引用日期2026-10-08]
  6. 具体实施方式 . googleapis.com [引用日期2026-10-08]
  7. 语音同步转文字的AI底层逻辑_讯飞开放平台 . xfyun.cn [引用日期2026-10-08]
  8. Mamba for Streaming ASR Combined with Unimodal Aggregation . ieee.org [引用日期2026-10-08]
  9. arxiv.org 上的网页 . arxiv.org [引用日期2026-10-08]
  10. CN117063228A(PDF) . googleapis.com [引用日期2026-10-08]
  11. INTERSPEECH 2021 . isca-archive.org [引用日期2026-10-08]
  12. 语言识别 . baidu.com [引用日期2026-10-08]
  13. content . uned.es [引用日期2026-10-08]
  14. arxiv.org 上的网页 . arxiv.org [引用日期2026-10-08]
  15. 端到端流式语音识别:技术演进与未来展望 . baidu.com [引用日期2026-10-08]
  16. Unifying Streaming and Non-streaming Zipformer-based ASR . aclanthology.cn [引用日期2026-10-08]
  17. CN118076997A(PDF) . googleapis.com [引用日期2026-10-08]
  18. E2E SEGMENTATION IN A TWO-PASS CASCADED ENCODER ASR MODEL . cornell.edu [引用日期2026-10-08]
  19. 实时语音识别API的五大核心参数优化指南_讯飞开放平台 . xfyun.cn [引用日期2026-10-08]
词条评价
词条统计

浏览次数:7 次

阅读量:3 次 · 阅读完成量:1 次

最近更新:2026-10-08T12:40:32Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
梅尔频率倒谱系数 自动语音识别 连接时序分类 循环神经网络换能器 隐马尔可夫模型 注意力机制 梅尔频率倒谱系数
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。