新闻详情

新闻详情

首页 / 资讯中心 / 详情

蒲公英书可视化解读:循环神经网络的时间展开与 LSTM / GRU 门控机制

发布时间:2026/10/1 9:43:59来源:尧图网络
蒲公英书可视化解读:循环神经网络的时间展开与 LSTM / GRU 门控机制
【免费下载链接】nndl邱锡鹏《神经网络与深度学习》第二版与通识版电子书、章节目录、学习资源与勘误。项目地址https://gitcode.com/GitHub_Trending/nn/nndl点击查看免费下载本文基于邱锡鹏《神经网络与深度学习第二版》配套可视化资源中的 RNN / LSTM / GRU 页面系统讲解循环神经网络RNN的时间展开原理、LSTM 三门控与细胞状态结构、GRU 的双门控简化设计以及字符级 RNN 生成的工作方式。读完本文你将掌握 RNN 系列模型的统一视角——同一单元在时间轴上展开成深网络并能看懂 LSTM 的遗忘门 / 输入门 / 输出门与 GRU 的更新门 / 重置门各自的职责和对应的数学形式为阅读书中第 6 章及动手实现循环网络打下基础。这个页面在仓库中的位置该可视化页面隶属于本仓库的 可视化资源总览页按《神经网络与深度学习第二版》章节顺序编排被归入第 6 章 · 循环神经网络。总览页通过 viz-card.html 这一通用卡片组件把各可视化页面组织成卡片网格每张卡片由url、title、blurb与thumb四个参数驱动渲染{% include viz-card.html url/viz/rnn-lstm/ titleRNN / LSTM / GRU blurb循环神经网络的时间展开、LSTM 三个门控、GRU 简化结构。 thumbhttps://colah.github.io/posts/2015-08-Understanding-LSTMs/img/LSTM3-chain.png %}从书目元数据_data/books.yml可以看到循环神经网络既是理论主线《神经网络与深度学习第二版》的第 6 章也是配套实战书《神经网络与深度学习案例与实践》的第 6 章。也就是说你可以先通过本可视化页面建立 LSTM / GRU 的直观图景再对照实践篇第 6 章的 PyTorch notebook 把门控结构落成可运行代码阅读路径 中教材章节 可视化资源的组合读法正是推荐这样搭配。本页面的核心内容可概括为四件事RNN 的时间展开、LSTM 单元、GRU 单元与字符级 RNN 生成下面逐一展开。RNN 的时间展开把循环变成深度循环神经网络与普通前馈网络最本质的区别在于隐藏层神经元之间存在循环连接当前时刻的隐藏状态同时取决于当前输入和上一时刻的隐藏状态。为了用静态的网络图描述这种动态过程标准做法是进行时间展开unrolling。展开之后同一个 RNN 单元会在时间维度上被复制成多个副本相邻副本之间通过隐藏状态传递信息整体等价于一个深度等于序列长度的前馈网络。这里有两个关键点权重共享所有时刻副本共享同一组参数输入权重、隐藏权重、偏置因此序列再长模型的参数量也不随长度增长——这是 RNN 能够处理任意长度序列的结构基础也是它与把每一步单独建模的普通前馈网络的根本区别。深度即序列长度展开后的网络深度等于时间步数T反向传播需要在时间轴上逐层回传误差这一过程称为沿时间反向传播Backpropagation Through TimeBPTT。也正是因为展开后的网络深RNN 在长序列上会遇到严重的**梯度消失vanishing gradient**问题误差信号在沿时间反向传播时经过多次矩阵连乘若循环权重矩阵的谱半径小于 1梯度会指数级衰减导致网络几乎无法学习远距离依赖如多年前的主语与句尾的谓语之间的对应关系。LSTM 正是为了解决这个问题而被提出的。从源码结构看本页面在仓库中的定位是第 6 章 · 循环神经网络的直观演示入口书中第 6 章则负责给出上述展开、BPTT 与梯度消失的完整数学推导。LSTM 单元三个门控 一条细胞状态主线LSTMLong Short-Term Memory长短期记忆的核心思路是引入一个独立的细胞状态cell state并让它沿时间轴以近乎线性的方式流动——允许信息原样通过从而为梯度提供一条不易衰减的高速公路。整体结构LSTM 单元的整体结构可以概括为细胞状态是贯穿上方的一条水平主线三个门控遗忘门、输入门、输出门协同调控这条主线的读写。整个计算可以拆解为以下几步遗忘门forget gate——决定丢弃多少旧细胞状态。它读取上一时刻隐藏状态h_{t-1}与当前输入x_t通过 sigmoid 输出一个 01 之间的值逐元素乘到旧细胞状态C_{t-1}上f_t σ(W_f · [h_{t-1}, x_t] b_f)f_t接近 1 表示保留接近 0 表示遗忘。输入门input gate——决定写入哪些新信息。它同样以 sigmoid 输出一个 01 的写入开关i_t同时用 tanh 生成候选新内容C̃_ti_t σ(W_i · [h_{t-1}, x_t] b_i) C̃_t tanh(W_C · [h_{t-1}, x_t] b_C)细胞状态更新——旧状态 × 遗忘门 新信息 × 输入门。这是 LSTM 的核心配方C_t f_t ⊙ C_{t-1} i_t ⊙ C̃_t⊙表示逐元素相乘。旧状态先按遗忘门的比例衰减再叠加被输入门放行的新候选内容完成一次读写。输出门output gate——决定输出哪部分细胞状态。输出门先以 sigmoid 决定哪些细胞状态值得对外暴露再用 tanh 把细胞状态压缩到 (-1, 1) 区间后相乘得到当前隐藏状态o_t σ(W_o · [h_{t-1}, x_t] b_o) h_t o_t ⊙ tanh(C_t)为什么能缓解梯度消失从公式可以看到细胞状态C_t对C_{t-1}的依赖是逐元素相乘f_t ⊙ C_{t-1}而非矩阵相乘且遗忘门f_t的值被 sigmoid 约束在 01 之间。这意味着只要遗忘门接近 1梯度就可以近乎无损地沿细胞状态干线反向传播从而显著缓解长依赖上的梯度消失问题——这正是 LSTM 相对朴素 RNN 最关键的改进。GRU 单元把三个门精简成两个GRUGated Recurrent Unit门控循环单元在保留门控 记忆思想的前提下做了大幅简化将 LSTM 的三个门缩减为两个更新门 重置门并合并细胞状态与隐藏状态从而减少参数、降低计算量且在许多任务上表现与 LSTM 相当。重置门reset gate决定忽略多少过去的隐藏状态r_t σ(W_r · [h_{t-1}, x_t])更新门update gate决定新信息与旧信息各保留多少同时承担了 LSTM 遗忘门与输入门的双重职责z_t σ(W_z · [h_{t-1}, x_t])候选隐藏状态用重置门过滤后的历史信息与当前输入共同生成h̃_t tanh(W · [r_t ⊙ h_{t-1}, x_t])最终隐藏状态是旧状态与新候选的加权融合权重由更新门控制h_t (1 - z_t) ⊙ h_{t-1} z_t ⊙ h̃_t可以看到当z_t接近 1 时h_t几乎完全保留旧状态h_{t-1}这为梯度提供了一条近似的直通路径与 LSTM 中细胞状态的作用异曲同工。LSTM 与 GRU 对照对比维度LSTMGRU门控数量3 个遗忘门、输入门、输出门2 个更新门、重置门记忆载体独立的细胞状态C_t 隐藏状态h_t仅隐藏状态h_t二者合并遗忘 / 写入控制遗忘门与输入门分开控制更新门统一控制新旧信息的比例参数量更多W_f, W_i, W_C, W_o四套权重更少W_r, W_z, W三套权重长依赖能力强细胞状态干线 门控强更新门近似直通路径两条门控主线的设计哲学是一致的让信息可以选择性地记住或遗忘从而为梯度提供更顺畅的传播通道。GRU 是 LSTM 的轻量替代在训练效率与效果之间提供了很好的折中。字符级 RNN 生成把循环网络变成文本生成器理解了 LSTM / GRU 的单元结构后一个经典的落地演示是字符级 RNN 文本生成char-level RNN generation让网络一个字符一个字符地生成文本每一步的输入恰好是上一步的输出。工作机制输入表示把词表这里即字符集中的每个字符映射为一个向量one-hot 或嵌入向量当前字符作为时刻t的输入x_t。循环推进RNN / LSTM / GRU 单元结合x_t与上一时刻隐藏状态h_{t-1}更新h_t即读入一个字符更新一次记忆。概率输出在每一步末尾通过 softmax 把隐藏状态映射为下一个字符的概率分布从中采样得到t1时刻的输入。训练方式训练时常用教师强制teacher forcing——把真实的下一个字符作为输入而不是把模型自己采样的结果喂回去从而加快收敛生成时则完全自回归——模型自己采样的输出作为下一步输入逐字符累积成一段完整文本。为什么它有意义字符级生成演示直观展示了循环网络的记忆与预测能力经过充分训练后模型能够学会字符间的局部统计规律乃至一定的长程结构例如引号配对、换行缩进等每一时刻的输出是下一时刻的输入这一闭环正是循环结构最自然的应用方式也是后面序列到序列Seq2Seq模型的基础。本仓库的 基于 RNN 的序列到序列模型 页面正是这一思路的延伸编码器—解码器结构让 RNN 从逐字符生成升级为读完整个输入序列后逐步生成输出常用于机器翻译可视为理解完 LSTM / GRU 单元后的下一个学习台阶。如何在本仓库中继续深入回到可视化总览在 可视化资源 的第 6 章 · 循环神经网络分类下可找到本页面入口同一分类下的序列建模专题还提供了 RNN、CNN、Transformer 三种 Seq2Seq 架构的横向对比。对照理论章节本页面对应《神经网络与深度学习第二版》第 6 章见 _data/books.yml 中 theory 书目的章节目录书中给出展开、BPTT、梯度消失与门控机制的完整推导。配合动手实现配套的《案例与实践》第 6 章同样见 _data/books.yml 的 practice 书目提供循环网络的可运行 notebook 与 sanity 测试可以把本文的门控公式逐一对应到代码。参与维护原文档中留有 TODO 注释——页面当前直接外链 Chris Olah 与 Andrej Karpathy 的经典配图CC-BY 许可并已注明出处如需镜像至本站可下载至assets/viz/并替换src之后在 rnn-lstm.md 中更新图片路径即可。理解循环神经网络的关键在于始终抓住两条主线时间展开使循环变成深度而门控机制LSTM 的三门、GRU 的两门专门为对抗展开带来的梯度消失而设计。有了这两条主线无论是阅读书中第 6 章还是阅读后续的 Seq2Seq、注意力机制与 Transformer 章节都会顺畅很多。赞分享【免费下载链接】nndl邱锡鹏《神经网络与深度学习》第二版与通识版电子书、章节目录、学习资源与勘误。项目地址https://gitcode.com/GitHub_Trending/nn/nndl点击查看免费下载相关推荐专业级开源网络监控系统高可用架构实战指南5个关键步骤构建企业级LibreNMS Docker部署专业级开源网络监控系统高可用架构实战指南5个关键步骤构建企业级LibreNMS Docker部署 LibreNMS作为功能全面的开源网络监控系统在企业IT运终极指南使用TensorFlow进行时间序列预测的完整教程终极指南使用TensorFlow进行时间序列预测的完整教程 TensorFlow时间序列预测是机器学习和深度学习领域的重要应用特别是在金融、气象、销售预测等教程深度学习机器学习用mise和Nix管理Herdr版本面向开发者的完整指南用mise和Nix管理Herdr版本面向开发者的完整指南 如果你在用 Herdr ——面向 AI 编码代理的终端工作区管理器——那么版本管理就是绕不开的技能。开发工具CLI代码智能体人工智能上一篇PowerCat在企业环境中的应用合规使用的最佳实践指南下一篇Res-Downloader终极指南一键下载全网视频音频资源的高效解决方案创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

教培机构AI推荐系统的Evaluation框架设计:如何量化推荐质量并持续优化 2026/10/1 10:25:52

教培机构AI推荐系统的Evaluation框架设计:如何量化推荐质量并持续优化

引言教培机构在做AI获客优化时,最常遇到的问题不是"不知道该优化什么",而是"不知道怎么衡量优化效果"。做了信息一致性修正、补全了课程描述、积累了场景化口碑——这些动作做完后,AI推荐效果变好了吗?很多机…

阅读更多 →
开源智能体框架Jev本地部署实战:从环境配置到API调用全流程 2026/10/1 10:25:52

开源智能体框架Jev本地部署实战:从环境配置到API调用全流程

如果你最近在逛开源社区,大概率会刷到“Jev”这个名字。Jev是一个把大模型对话、工具调用、任务编排整合到一起的开源智能体框架,你可以把它部署到自己的电脑或服务器上,数据不出本地,接口完全由自己掌控。对我来说,它…

阅读更多 →
AI 幻觉抑制与需求对齐 —— 落地方案 2026/10/1 10:25:45

AI 幻觉抑制与需求对齐 —— 落地方案

适用:Claude Code / 任意 LLM 编码助手 | 场景:Android App Framework 定制开发(可推广)0. 方案总览 幻觉不是单一问题,是五类问题的统称。方案按「事前预防 → 事中控制 → 事后验证」三层设计: ┌───…

阅读更多 →
减重补贴战的产业账本:5家巨头用现金购买AI健康管理的入口、数据与信任 2026/10/1 10:25:45

减重补贴战的产业账本:5家巨头用现金购买AI健康管理的入口、数据与信任

【摘要】2026年,京东、蚂蚁、腾讯等5家巨头发起减重补贴战:体脂秤近乎白送,打卡奖金最高1000元。补贴购买的不是体重数据,而是AI健康管理的4层资产——高频入口、数据闭环、慢病渗透与金融筹码。复盘竞争图谱与留存、合规约束可见…

阅读更多 →
firewalld IP 白名单实战:只允许特定 IP 访问指定端口 2026/10/1 10:25:45

firewalld IP 白名单实战:只允许特定 IP 访问指定端口

生产环境里给数据库、缓存、后台管理端口做 IP 白名单,是我这些年做过最多的防火墙操作,没有之一。Linux 防火墙 firewall 只允许特定 IP 访问这件事,听起来就是一条规则的事,但真到线上,往往会在"规则写了却没生…

阅读更多 →
Docker 部署 Elasticsearch + Kibana:电商数据检索入门实战 2026/10/1 10:25:44

Docker 部署 Elasticsearch + Kibana:电商数据检索入门实战

1. 引言 Elasticsearch 是基于 Lucene 的分布式搜索与分析引擎,具备强大的全文检索、聚合统计和日志分析能力;Kibana 则是 Elasticsearch 官方的数据可视化与探索平台,常用于数据查询、仪表盘展示和集群监控。 本文以 Elasticsearch 8.15.0 和…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉