新闻详情

新闻详情

首页 / 资讯中心 / 详情

大模型注意力机制整理

发布时间:2026/10/1 21:28:39来源:尧图网络
大模型注意力机制整理
各模型注意力机制 层数汇总模型注意力机制层数层分配混合模型的逐层安排DeepSeek R1MLA61全层 MLADeepSeek V3MLA61全层 MLADeepSeek V3.2DSA稀疏61全层 DSAMLA 上实例化 indexerDeepSeek V4-FlashSWA CSA HCA43前 2 层纯 SWA后 41 层 CSA/HCA 逐层交错DeepSeek V4-ProCSA HCA61前 2 层 HCA后 59 层 CSA/HCA 逐层交错GLM 5.2MLA DSA78全层 MLADSAIndexShare 让索引器每 4 层算一次、后 3 层复用Kimi K2MLA61全层 MLAKimi K3KDA MLA9369 层 KDA 24 层 MLA约 3:1 交错Qwen2 / 2.5 / 3GQA依尺寸而异全层 GQAQwen3.5 / 3.6Gated DeltaNet 全注意力依尺寸如 35B-A3B40 层30 层 DeltaNet 10 层全注意力3:1 交错主流注意力机制实现原理一、传统/分组类1. GQAGrouped Query Attention分组查询注意力原理多头注意力中把 query head 分成 G 组组内多个 query 共享同一套 K/V head。效果相比 MHAKV cache 缩小为 1/G比 MQA全部共享一组质量损失更小是两者折中。代表Qwen2/2.5/3、Llama 3、GLM 4.x。2. MQAMulti-Query Attention原理GQA 的极端情况G1所有 query head 共享唯一的 K/V head。效果KV cache 最小但质量损失最大现已被 GQA/MLA 取代。二、低秩压缩类3. MLAMulti-head Latent Attention多头潜在注意力原理KV 先经下投影矩阵W^DKV压到低维 latent 向量c_KV只缓存这个 latent计算时再经上投影W^UK / W^UV还原各头 K/V。位置信息用decoupled RoPE单独注入不污染低秩压缩。吸收技巧decode 时把W^UK吸收进W^UQ、W^UV吸收进W^O无需显式还原完整 K/V。效果KV cache 从每头一份变成每 token 一个 latent 向量省 3~5 倍存储。代表DeepSeek V2/V3/R1、Kimi K2。三、稀疏选择类省计算/带宽不省存储4. DSADeepSeek Sparse Attention稀疏注意力原理两阶段索引 精选。轻量闪电索引器lightning indexerMQA 结构、128 维、FP8给所有历史 token 快速打分选出top-k如 2048个 token主 MLA 注意力只在这 k 个 token 上计算。index scoreI_{t,s} Σ_j w^I_{t,j} · ReLU(q^I_{t,j} · k^I_s)效果复杂度 O(L²) → O(Lk)。省读取带宽不省存储因为 top-k 每次变必须全量存。代表DeepSeek V3.2、GLM 5.x。5. NSANative Sparse Attention原生稀疏注意力原理单层内三路并行 门控融合压缩分支连续 token 压成块摘要block summary选择分支根据摘要粗选 top-n 块只算选中块滑窗分支最近 w 个 token 稠密注意力。特点原生稀疏训练训练时就模拟稀疏避免训练稠密、推理剪枝的性能损失。落地情况未落地到任何发布模型复杂度太高是 DSA 的学术前身。四、压缩 稀疏类真正省存储6. CSACompressed Sparse Attention压缩稀疏注意力原理先沿序列维度压缩每 m4 个连续 token 压成 1 个 KV entry再在压缩 entry 上做DSA 稀疏 top-k选择k512/1024。效果压缩省存储约 4 倍稀疏省读取。代表DeepSeek V4。7. HCAHeavily Compressed Attention重度压缩注意力原理更激进的压缩每 m128 个 token 压成 1 个 entry压缩后保持稠密注意力对所有压缩块都算。效果存储省最多约 128 倍块数极少故稠密也能接受。代表DeepSeek V4。五、滑窗类8. SWASliding Window Attention滑动窗口注意力原理每个 token 只关注最近 w 个 token的稠密注意力窗口外的历史直接丢弃。效果KV cache 只保留最近 w 个计算和存储都固定。局限丢失长程信息需配合其他全局机制如 V4 的 CSA/HCA使用。六、线性注意力类DeltaNet 系9. KDAKimi Delta Attention原理基于DeltaNet的线性注意力用delta 规则做递推状态更新S_t S_{t-1} k_t ⊗ (β_t · (v_t - S_{t-1}^T k_t))即先用 K 查出旧值只写新旧之差delta类似数据库 UPSERT精确覆盖不留残影。改造点Moonshot 加入门控 per-channel decay逐通道衰减用分块并行 kernel实现高效训练。效果用固定大小的递推状态矩阵替代随序列增长的 KV cache。代表Kimi K369/93 层。10. Gated DeltaNetQwen 的线性注意力原理与 KDA 同属 DeltaNet 系核心差异是加数据依赖的遗忘门 α_tgating话题切换时主动遗忘旧记忆。混合方式Qwen3.5/3.6 按3:1交错——3 层线性承担粗粒度语义混合 1 层全注意力承担精确检索校正。代表Qwen3.5 / Qwen3.6。NSA的一点分析混合注意力机制的模型都是分层选择不同注意力。同一层内采用不同注意力首先大概率是互斥的比如MHA和MLA、DSA本身就互相冲突。只有DeepSeek论文中的NSA在同一层采用SWADSA混合的方式对于近2048个token采用稠密注意力2048个token之前的token采用稀疏注意力而这种机制由于实现复杂度最终没有工程化落地。NSA 真正的落地难点三块三套 KV 格式并存压缩块摘要 全量原始 KV选择分支要 gather 被选块 滑窗原始 KV。每层要同时维护三种 cache增删策略各不相同。滑窗边界动态最近 w 个 token 的窗口每个 decode 步都往后挪一位需要环形 buffer 之类的高效增删机制这就是你说的实时更新。压缩是增量、异步的每凑满 l 个 token 才生成一个新块摘要末尾永远有个没凑满的尾巴块压缩和 attention 之间存在时间差。再加上三路注意力 门控融合需要专门 kernel、gather 选中块的访存不规则——这些都是硬件对齐的硬骨头。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

ASP.NET三层架构实战:Web.config、Session与GridView深度解析 2026/10/1 23:17:04

ASP.NET三层架构实战:Web.config、Session与GridView深度解析

简介:这是一份基于ASP.NET Web Forms开发的三层架构在线聊天室源码,面向初学者与Web开发入门者,用于理解B/S架构下用户交互、数据库操作与页面逻辑分离的设计思想。资源包含19个文件,涵盖7个C#业务逻辑文件(如Speak.as…

阅读更多 →
微多边形时代的光栅化:软硬协同渲染架构深度解析 2026/10/1 23:17:04

微多边形时代的光栅化:软硬协同渲染架构深度解析

做渲染引擎这些年,我越来越觉得“光栅化”这个名词已经装不下我们正在做的事情了。过去一说光栅化,大家脑子里就是三角形进、像素出,GPU里一条固定的硬件管线,性能稳定、结果可控。但这两年,微多边形概念的回归&#x…

阅读更多 →
NLOS环境下三维TOA定位MATLAB仿真:加权最小二乘抑制测距误差 2026/10/1 23:17:04

NLOS环境下三维TOA定位MATLAB仿真:加权最小二乘抑制测距误差

在室内定位、无人机集群协同、智慧仓储这些场景里摸爬滚打过的朋友,大概率都绕不开一个问题: 非视距(NLOS)误差怎么处理 。我最早做UWB定位时,在楼道拐角处测出来的坐标能飘出去两三米,当时还以为是硬件问…

阅读更多 →
从零搭建免费AI文本检测器:基于困惑度与突发性的本地化方案 2026/10/1 23:17:03

从零搭建免费AI文本检测器:基于困惑度与突发性的本地化方案

1. 从零搭建一个免费AI文本检测器的完整思路最近半年,身边做内容的朋友几乎都在焦虑同一件事:自己辛辛苦苦写的东西,被平台判定成AI生成;反过来,又担心收到的稿件、论文、文案是AI糊弄出来的。这种双向的不信任&#x…

阅读更多 →
OpenClaw智能体本地部署与GDPR合规:从WSL2到Teams的工程实践 2026/10/1 23:17:03

OpenClaw智能体本地部署与GDPR合规:从WSL2到Teams的工程实践

1. 先搞清楚我们到底在聊什么最近我在折腾智能体框架,把 OpenClaw 部署到了本地环境,顺便接上了 OBSIDIAN 笔记和 Microsoft Teams。聊起这个项目时,身边好几个做海外工具的朋友第一反应是:你就不怕 GDPR 找上门?说实话…

阅读更多 →
FEX-Emu + Wine + DXMT:跨平台运行x86-64 Windows应用实战 2026/10/1 23:16:56

FEX-Emu + Wine + DXMT:跨平台运行x86-64 Windows应用实战

1. 从"Madeira"这个名字说起:一个跨平台兼容层的野心 第一次看到"Madeira"这个项目名,很多人会以为是某个旅游项目或者葡萄酒品牌。但在跨平台兼容和系统仿真这个圈子里,这个名字背后代表的是一类非常硬核的技术方向——…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉