长短期记忆网络

义项:循环神经网络结构
长短期记忆网络

长短期记忆网络(Long Short-Term Memory,LSTM)是循环神经网络(RNN)的一种变体结构,专门用于处理序列数据并捕捉其中的长距离依赖关系[1]。它通过在循环单元中引入门控机制和独立的单元状态,缓解了普通循环神经网络在长序列上出现的梯度消失与梯度爆炸问题[2]。1997 年由霍赫赖特和施密德胡贝尔提出后,LSTM 成为语音识别、机器翻译、手写识别和时间序列预测等任务中广泛使用的基础模型之一。

目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

长短期记忆网络是一种带门控机制的循环神经网络结构,其基本计算单元称为 LSTM 单元。与普通循环神经网络只在隐藏层保留一个状态不同,LSTM 单元额外维护一个贯穿时间步传递的单元状态,用来保存较长时间尺度的信息,同时保留原有的隐藏状态[3]。

该结构的核心在于用可学习的门控制信息的写入、保留与读出,因此能在较长的时间跨度上决定哪些历史信息需要记住、哪些可以丢弃[4]。由于这种设计,LSTM 被普遍视为处理序列数据的基础结构之一,也是循环神经网络家族中使用最广的单元形式[5]。

原理

一个 LSTM 单元在每个时间步接收 3 类输入:当前时刻的输入向量 $x_t$、上一时刻的隐藏状态 $h_{t-1}$ 和上一时刻的单元状态 $C_{t-1}$;输出为当前时刻的隐藏状态 $h_t$ 与更新后的单元状态 $C_t$[6]。单元内部有 3 个门:遗忘门 $f_t$ 决定单元状态中哪些部分需要舍弃,输入门 $i_t$ 决定哪些新信息要写入单元状态,输出门 $o_t$ 决定单元状态的哪些部分要作为当前输出[7]。

各门的计算通常写成如下形式,其中 $\sigma$ 为 S 型函数,$\odot$ 表示逐元素相乘:$f_t=\sigma(W_f x_t+U_f h_{t-1}+b_f)$,$i_t=\sigma(W_i x_t+U_i h_{t-1}+b_i)$,$o_t=\sigma(W_o x_t+U_o h_{t-1}+b_o)$[8]。候选状态由双曲正切函数生成,单元状态与隐藏状态按 $C_t=f_t\odot C_{t-1}+i_t\odot \tanh(W_c x_t+U_c h_{t-1}+b_c)$ 与 $h_t=o_t\odot \tanh(C_t)$ 更新[5]。

从信息流动的角度看,单元状态构成一条自始至终贯穿的线性通路,误差信号可以沿这条通路较稳定地反向传播,从而避免梯度快速衰减[9]。LSTM 的学习算法在空间和时间上都是局部的,每个时间步、每个权重的计算复杂度为 $O(1)$,因此可以跨越上千个时间步的信息间隔[9]。

发展历程

1997 年,泽普·霍赫赖特与于尔根·施密德胡贝尔在《神经计算》期刊发表论文,提出 LSTM 结构,用以解决普通循环神经网络难以学习长时依赖的问题,论文刊于该刊第 9 卷第 8 期第 1735 至 1780 页[7]。最初的版本只包含输入门与输出门,没有遗忘门和窥孔连接[3]。

2000 年,费利克斯·格斯与施密德胡贝尔等人提出自适应遗忘门,使单元能够在处理连续输入流时学会在合适时机重置自身状态,避免状态无限增长导致网络失效[10]。同年他们又为单元加入从内部状态指向各门的窥孔连接,以提升对时间间隔的精确刻画能力[9]。

2005 年,双向 LSTM 与在时间上完全反向传播的变体被提出;2006 年联结主义时间分类(CTC)方法出现,用于同时完成序列对齐与识别。2007 年研究团队将 CTC 与 LSTM 结合用于语音处理,2009 年该方法在 3 项国际手写识别竞赛中取得成绩。2014 年,Cho 等人提出结构更简单的门控循环单元(GRU),被视为 LSTM 的一类变体[7]。

应用

LSTM 主要用于序列数据的建模与预测,典型任务包括语音识别、机器翻译、手写识别和语言模型等[11]。在语音方向,经 CTC 训练的 LSTM 曾用于移动端语音识别系统;在翻译方向,2016 年前后的部分端到端机器翻译系统采用两个相连的 LSTM 分别处理输入文本和输出译文。

除文本与语音外,LSTM 也用于时间序列预测、信号处理、手写生成、为图像生成标题和句法解析等任务,还被用于视频识别、机器人控制和医疗诊断等场景。在语音识别与自然语言处理的混合系统中,LSTM 常作为语言模型或声学模型的一部分,与全连接层配合完成分类[8]。

局限

LSTM 引入了门控结构和额外的单元状态,参数与计算量高于普通循环神经网络,在同等算力下训练效率相对更低。其核心计算是矩阵与向量相乘,LSTM 层包含 4 个这样的计算块,运算量和内存访问量都很大[12]。

由于每个时间步的计算必须等待上一时间步完成,LSTM 在时间维度上难以并行化,这一串行特性限制了训练与推理速度[12]。尽管门控机制缓解了梯度消失,但这类模型仍难以捕捉极长距离的依赖,实践中能可靠保留的长期信息长度有限。

此外,LSTM 的可解释性较弱,性能对训练数据的规模和质量有较强依赖[11]。随着基于自注意力机制的 Transformer 等结构出现并在多项序列任务上取得进展,LSTM 在部分领域的应用位置被逐步替代。

参见

  • 循环神经网络 —— LSTM 所归属的神经网络大类,处理序列数据的基础结构。

  • 门控循环单元 —— 在 LSTM 之后提出、结构更简化的门控循环单元变体。

  • 梯度消失问题 —— LSTM 的门控与单元状态设计所针对的核心训练难题。

  • Transformer —— 基于自注意力机制、在部分序列任务中替代 LSTM 的模型结构。

  • 双向循环神经网络 —— 由两个方向相反的循环网络组成,常与 LSTM 单元结合使用。

参考资料

  1. [科普中国]-长短期记忆人工神经网络 - 版权归原作者所有,如有侵权,请联系我们 . kepuchina.cn [引用日期2026-10-08]
  2. google.com 上的网页 . google.com [引用日期2026-10-08]
  3. 全屏显示 专题 章节 . chaoxing.com [引用日期2026-10-08]
  4. Long Short-Term Memory . sciencedirect.com [引用日期2026-10-08]
  5. 算法 (Werbos, 1988) 进行优化 . ccf.org.cn [引用日期2026-10-08]
  6. Long Short-Term Memory Networks . sciencedirect.com [引用日期2026-10-08]
  7. google.com 上的网页 . google.com [引用日期2026-10-08]
  8. Long Short-Term Memory - Chapters and Articles . sciencedirect.com [引用日期2026-10-08]
  9. Learning Precise Timing with LSTM Recurrent Networks . umontreal.ca [引用日期2026-10-08]
  10. Learning-to-Forget-Continual-Prediction-with-LSTM . mit.edu [引用日期2026-10-08]
  11. 大模型开发:描述长短期记忆网络(LSTM)和它们在序列数据上的应用。 . aliyun.com [引用日期2026-10-08]
  12. Recurrent Neural Networks: An Embedded Computing Perspective . arxiv.org [引用日期2026-10-08]
词条评价
词条统计

浏览次数:3 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-10-08T12:40:32Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
循环神经网络 门控循环单元 梯度消失问题 Transformer 双向循环神经网络
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。