新闻详情

新闻详情

首页 / 资讯中心 / 详情

Transformer 深入浅出:从问题推导到大语言模型核心架构

发布时间:2026/10/1 17:54:03来源:尧图网络
Transformer 深入浅出:从问题推导到大语言模型核心架构
Transformer 深入浅出从问题推导到大语言模型核心架构从一个问题开始理解 Transformer而不是背 Q/K/V、Attention 公式。1. 为什么需要 Transformer在 Transformer 出现之前NLP自然语言处理主要依赖 RNN、LSTM 等循环神经网络。例如我昨天去了银行办理贷款。传统 RNN 的处理方式我 ↓ 昨天 ↓ 去 ↓ 银行 ↓ 办理 ↓ 贷款模型需要按照顺序逐个读取。这种方式存在两个核心问题问题 1无法充分并行GPU 擅长矩阵计算但是 RNN 必须第1个词处理完成 ↓ 第2个词处理 ↓ 第3个词处理前一个时间步完成之前后一个无法开始。因此训练效率较低。问题 2长距离依赖困难例如我小时候住在北京后来去了很多城市二十年后我又回到了这里。模型需要知道这里 ↓ 北京二者距离很远。RNN 需要经过很多计算步骤传递信息容易丢失。因此出现一个核心问题一个词如何直接关注句子中其他相关的词这就是 Attention 的来源。2. Transformer 的核心思想Transformer 的核心让每个 token 根据当前上下文动态决定应该关注哪些 token。例如我 去 银行 办理 贷款理解银行时模型发现办理 贷款和它关系更强。于是银行 办理 贷款共同决定“银行”的当前含义。这就是Contextual Representation 上下文表示同一个词bank在不同句子I went to the bank. I sat near the bank of the river.会产生不同含义。3. 输入文字如何进入 Transformer计算机不能直接理解银行所以第一步Tokenization文本我喜欢人工智能转换token1 token2 token3然后Embedding每个 token 转换成向量银行 ↓ [0.21, -0.53, 0.88 ...]假设d_model 768那么一个 token768维向量一句话seq_len × d_model例如10 × 7684. 为什么需要 Position EncodingAttention 有一个特点它只关心 token 之间的关系。但是我打你和你打我如果没有位置信息模型不知道顺序。因此 Transformer 加入Position Encoding最终输入Token Embedding Position Information告诉模型这个词是什么 这个词在哪里现代大模型中常见RoPE Rotary Position Embedding也是为了解决位置信息问题。5. Self-AttentionTransformer 的核心Attention 解决的问题当前 token 应该关注哪些 token例如我 去 银行 办理 贷款处理银行时需要判断我 去 银行 办理 贷款哪个重要。于是产生Q K V6. Q、K、V 到底是什么不要把 Q/K/V 理解成三个输入。它们来自同一个输入X通过三个不同的线性变换Q XWq K XWk V XWv其中Wq Wk Wv都是模型训练出来的参数。Query表示我想寻找什么信息例如银行我想知道哪些词和我的金融含义相关Key表示我是什么类型的信息例如贷款我是金融相关信息Value表示如果关注我我提供什么内容所以 Attention 的流程7. Attention 公式解析公式拆开第一步QKᵀ计算Query 和 所有 Key的相似度。得到token之间的关系矩阵例如我 去 银行 办理 贷款 我 去 银行 办理 贷款每个位置代表一个 token 对另一个 token 的关注程度第二步Softmax把分数转换成概率例如办理 25% 贷款 60% 银行 7%表示银行主要关注贷款 办理第三步加权求和 V最终银行的新表示 0.25×办理信息 0.60×贷款信息 其他信息于是原来的银行变成和金融业务相关的银行8. 为什么需要 Multi-Head Attention一个 Attention 只能观察一种关系。但是语言包含很多关系例如小明因为小红生病所以他去医院看她。同时存在他 → 小明 她 → 小红 医院 → 生病因此 Transformer 使用Multi-Head Attention多个注意力头Head 1 关注语法 Head 2 关注指代 Head 3 关注语义关系最后Concat ↓ Linear融合。注意模型并没有人为规定Head1一定学语法这些关系是训练过程中自动形成的。9. FFNAttention 后为什么还需要它这是很多人容易误解的地方。Attention负责信息交换。FFN负责信息加工。例如Attention银行 获得 贷款信息 办理信息但是这些只是收集来的信息。FFN 进一步处理贷款 办理 银行 ↓ 形成更高级特征 ↓ 金融行为FFN 结构输入 ↓ Linear ↓ 激活函数 ↓ Linear ↓ 输出通常768维 ↓ 3072维 ↓ 768维为什么扩大因为更高维空间可以学习更多复杂组合。可以这样记Attention: 我应该看谁 FFN: 看完之后我应该如何理解10. Residual Connection 为什么存在Transformer 很深Block1 ↓ Block2 ↓ Block3 ...容易信息丢失梯度消失所以加入残差普通x ↓ Layer ↓ y残差x --------┐ ↓ Layer(x) x公式意思新学习的信息建立在原信息基础上。11. LayerNorm 的作用深层网络中不同层的数据分布可能变化。LayerNorm帮助稳定训练加速收敛防止数值异常简单理解调整数据分布 让网络更容易学习12. 一个 Transformer Block 的完整结构输入 ↓ Self Attention ↓ Residual ↓ Normalization ↓ FFN ↓ Residual ↓ Normalization ↓ 输出大量堆叠Block 1 ↓ Block 2 ↓ Block 3 ↓ ... ↓ Block N形成大型语言模型。13. 为什么高层表示更加抽象不是因为第1层负责语法 第30层负责推理这种固定划分。真实情况每一层都在Attention FFN不断加工。简单理解低层词之间的关系中层关系组合高层更复杂的语义模式例如第一层银行 关注 贷款中间层银行 贷款 办理更高层用户正在进行金融行为14. Decoder-only 为什么成为 GPT 的主流Transformer 最初Encoder Decoder例如翻译任务。后来发现很多任务只需要生成。于是出现Decoder-only代表GPT Llama Qwen DeepSeek它的特点只能看到过去我 今天 去不能看到未来银行因此使用Causal Mask保证预测当前 token 时不能偷看答案。15. GPT 如何生成文本输入中国的首都是流程Tokenizer ↓ Embedding ↓ Transformer ↓ Hidden State ↓ Linear ↓ Vocabulary概率得到北京 0.9 上海 0.02 广州 0.01选择北京然后中国的首都是北京继续预测。这叫Autoregressive Generation 自回归生成16. 为什么只预测下一个 token却能产生智能核心预测任务很简单但是为了预测准确模型必须学习复杂规律。例如预测法国的首都是需要知道法国 国家实体 首都 城市关系 巴黎 对应知识预测def binary_search():需要知道代码结构 算法逻辑 变量关系预测小明有3个苹果又买2个一共有需要知道数学推理过程因此next-token prediction ↓ 学习语言规律 ↓ 学习世界规律 ↓ 形成语义表示 ↓ 产生复杂能力17. Transformer 与 LLM 的完整链路最终文本 ↓ Tokenizer ↓ Embedding ↓ Position Encoding ↓ Transformer Blocks ↓ Self Attention ↓ FFN ↓ Residual Norm ↓ Hidden State ↓ LM Head ↓ 下一个 Token ↓ 循环生成18. 最终理解框架不要记Transformer QKV Softmax应该记文字无法计算 ↓ Embedding 词没有上下文 ↓ Attention 不知道位置 ↓ Position Encoding 信息需要加工 ↓ FFN 网络需要稳定训练 ↓ Residual Norm 不断堆叠 ↓ Transformer 预测下一个token ↓ LLM一句话总结Transformer 本质是一种通过 Self-Attention 建立 token 之间关系并通过 FFN 进行特征加工的深度神经网络架构。大型语言模型利用大量文本训练这个架构使其在预测 token 的过程中学习到语言、知识、代码和复杂任务模式。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

告别无标题:项目命名与标题撰写的底层逻辑与实操方法 2026/10/1 17:53:58

告别无标题:项目命名与标题撰写的底层逻辑与实操方法

站在“无标题”面前:项目命名的底层逻辑与实操心法一个文件命名为“无标题.doc”,一个文件夹叫“新建文件夹”,一篇博文写着“无标题”——这事我们都干过。但如果你把一个真正要交付的项目、一个要上线推广的产品、一篇要发布的内容也长期挂…

阅读更多 →
概要设计与详细设计:从架构蓝图到代码落地的实战指南 2026/10/1 17:53:57

概要设计与详细设计:从架构蓝图到代码落地的实战指南

1. 先搞清楚这两份文档到底在解决什么问题很多人一听到“概要设计”和“详细设计”,第一反应就是“又要写文档了”,然后开始痛苦地凑字。我在项目里见过太多次这种场景——开发同学对着模板憋半天,写出来的东西既没指导价值,也没人…

阅读更多 →
主动配电网源-荷-储协同优化调度:模型、求解与工程实践 2026/10/1 17:53:57

主动配电网源-荷-储协同优化调度:模型、求解与工程实践

1. 源-荷-储协同互动的内涵与主动配电网的“主动”所在做配电网优化调度这几年,我最大的感受是:“源-荷-储”这三个字,看着简单,真正把它们的协同关系讲清楚、建模建明白、调度调度得动的人,并不多。很多刚接触这个方向…

阅读更多 →
Kubernetes HPA 实战:从原理到自动扩容配置与避坑指南 2026/10/1 17:53:57

Kubernetes HPA 实战:从原理到自动扩容配置与避坑指南

半夜两点被监控电话吵醒,登录集群一看,某个服务的 Pod 已经被流量打到 CPU 100%,而 Deployment 的副本数还停留在白天的两个。这种手动kubectl scale的运维方式,说到底就是拿人肉当控制器——反应慢、容易漏、凌晨尤其痛苦。Kuber…

阅读更多 →
园区电力无人值守落地经验:从远程监控到智能调度 2026/10/1 17:53:57

园区电力无人值守落地经验:从远程监控到智能调度

不少朋友一听“园区电力无人值守”,第一反应就是“装几个摄像头、接个远程开关不就完事了”。真做过这个项目的人都知道,事情远没那么简单。我们园区从去年开始做配电房无人值守改造,前前后后折腾了大半年,中间推倒重来的方案、半…

阅读更多 →
从离职到上线,我用 TaoToken 统一 Key 打通出海产品 AI 能力 2026/10/1 17:53:50

从离职到上线,我用 TaoToken 统一 Key 打通出海产品 AI 能力

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉