新闻详情

新闻详情

首页 / 资讯中心 / 详情

初识RedKnot:一文完整看懂基于Head感知KV复用的长上下文LLM推理加速框架

发布时间:2026/9/29 16:18:26来源:尧图网络
初识RedKnot:一文完整看懂基于Head感知KV复用的长上下文LLM推理加速框架
初识RedKnot一文完整看懂基于Head感知KV复用的长上下文LLM推理加速框架【免费下载链接】RedKnotEfficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention项目地址: https://gitcode.com/gh_mirrors/re/RedKnotRedKnot 是一个构建在 SGLang 之上的模型感知长上下文 LLM 推理加速框架核心是 Head 感知 KV 复用Head-Aware KV Reuse与 SegPagedAttention 两大技术在长文本 RAG 场景可实现2–5× 首 token 延迟TTFT加速、70%–90% 计算量节省同时把质量回退换算控制在 1 个百分点以内。为什么长上下文推理需要专门加速随着 RAG检索增强生成、长文档问答等场景普及LLM 的输入动辄几十 K 到几百 K token传统推理路径面临三重压力KV Cache 内存暴涨KV 缓存随上下文长度线性膨胀显存成为并发上限Prefill 计算爆炸注意力计算随序列近似二次增长首 token 延迟TTFT被大幅拉长重复劳动多RAG 中大量文档段落跨请求重复出现但只有完全相同前缀才能被传统前缀缓存命中可复用但不同的内容只能反复重算。RedKnot 的思路不是简单换缓存策略而是在Head注意力头、Token令牌、Expert专家三个层级消除冗余计算并保持一条完整的在线 Recomputed 参考路径作为精度基准。RedKnot 三大核心机制Head、Token、Expert 三层优化机制一Head 感知 KV 复用只让重要头在线计算研究表明不同注意力头对长程上下文的依赖差异巨大。RedKnot 离线为每个(layer, head)打标签Head 类型行为处理方式Global全局头对远端内容敏感保留在线读取完整上下文Local局部头只需关注 sink 近期窗口离线预计算位置无关复用Retrieval检索头定位远端关键片段按需在线检索局部头的贡献离线准备好后投影合并回模型不改变模型对外接口。同一套抽象可映射到 MLA、MHA、GQA 和原生滑窗注意力。自动化的 Head 分类由 head_profiler.py 完成策略以 JSON 形式由 head_config.py 加载。机制二SegPagedAttention按头分页存储省显存又省带宽算法层面的头稀疏要变成真实收益还需要物理布局配合。SegPagedAttention 把 KV 页面与可见性组织成per-head、per-segment结构局部头物理上只存sink recent页全局头存完整页再用无 mask 的融合变长注意力内核FA-3 varlen一次性读取避免了密集存储 mask 屏蔽的隐性开销。运行时实现segpaged.py可独立作为 SGLang 注意力后端--attention-backend segpaged数值等价性测试test/srt/redknot/test_segpaged_duo_attention.py机制三Sparse FFN 与自适应专家 Top-K令牌级重要性决定 FFN 负载在 2–8K 短上下文段FFN 反而占 TTFT 的 57–62%。RedKnot 的 sparse_ffn.py 让深层网络只对重要 token执行密集 FFN其余走残差直通MoE 侧则用自适应专家 Top-K仅在路由分布需要时分配更多专家。多卡场景下专家子组与 All2All 通信结构如下图所示实测性能2–5× TTFT 加速70%–90% 计算节省主发布路径为DeepSeek-V4-Flash 8× NVIDIA H200TP8覆盖 4 个冻结的 LongBench 派生 RAG 测试套件套件目标 token 数文档几何64K65,5364 × 16,384128K131,0724 × 32,768256K262,1448 × 32,768440K450,5608 × 56,320关键结论 热态 TTFT 相比在线 Recomputed 参考路径加速 2–5× 计算账本节省70%–90%仅计算术计算不含访存与通信开销✅ 质量回退换算≤ 1 个百分点 完整复现脚本与冻结清单在 test/srt/redknot/一条命令即可重放全部四个套件。如何快速跑起 RedKnot先克隆仓库git clone https://gitcode.com/gh_mirrors/re/RedKnot然后根据你的硬件选择入口服务端启动脚本server/start_server_redknot_mla.shDeepSeek-V4-Flash redknot_mla后端、server/start_server_redknot_pro0813.shDeepSeek-V4-Pro-0813 认证路径RAG 端到端 Demoexamples/redknot/rag_redknot_demo.py 基于 HotpotQA 对比 Dense 基线与 RedKnot 的 F1/EM、TTFT 与 FLOPs 节省SegPagedAttention 微基准examples/redknot/segpaged_redknot_demo.py 隔离对比密集 KV mask 与按头分页布局的延迟与数值等价性详细参数与输出说明见 examples/redknot/README.md。SGLang 生态内也可以直接用前端语言体验多模态请求示例素材如 examples/frontend_language/quick_start/images/cat.jpeg仓库结构与生态速览路径说明python/sglang/srt/layers/attention/redknot/RedKnot 运行时核心Head 策略、SegPaged、Sparse FFN、MLA 集成test/srt/redknot/基准脚本、发布启动器、冻结数据集与结果server/DeepSeek-V4 系列服务端一键启动脚本docs/ASCEND.md华为 Ascend NPU 适配进展docs/advanced_features/推测解码、结构化输出等 SGLang 高级特性文档RedKnot 由社区共同构建合作方包括小红书、北京大学、华为、UB 量化、诠界等并已与 vLLM 核心代码完成迁移RedKnot-vLLM 分支。总结RedKnot 给出了长上下文 LLM 推理加速的一套完整答案Head 感知 KV 复用把可复用的头离线化SegPagedAttention让稀疏性落到物理存储Sparse FFN 自适应 Top-K再压缩 token 与专家级冗余。三者可组合、可插拔且有在线 Recomputed 路径兜底精度——如果你想让长文档、长上下文的 LLM 服务更快更省这个开源框架值得完整读一读。【免费下载链接】RedKnotEfficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention项目地址: https://gitcode.com/gh_mirrors/re/RedKnot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

AD21中Keepout与机械层互转的两种高效方法 2026/9/29 17:16:13

AD21中Keepout与机械层互转的两种高效方法

画板子的人大概都有过这种时刻:结构工程师丢过来一个DXF,里面板框、螺丝孔、禁止布线区全部画在机械层1上,你导入Altium Designer之后发现,走线时DCR报错报个不停——因为根本没有Keepout层对象。或者反过来,拿到的参考…

阅读更多 →
LCD1602 4线驱动详解:51单片机省IO口实战指南 2026/9/29 17:16:13

LCD1602 4线驱动详解:51单片机省IO口实战指南

做51单片机小项目的人,大概率都被LCD1602教育过。这块屏便宜、稳定、显示直观,几乎是电子实训和毕业设计里的标配外设,但它的接线方式一直让人头疼:数据线D0-D7要8根,控制线RS、RW、E还要3根,一共11个引脚。…

阅读更多 →
51单片机4线驱动LCD1602的Proteus仿真与代码实现 2026/9/29 17:16:13

51单片机4线驱动LCD1602的Proteus仿真与代码实现

直接进入正题——51单片机驱动LCD1602,网上教程一大把,但十有八九都是8线接法,占用8个IO口,一套下来P0口全搭进去了,想再挂个按键、传感器,IO口立刻捉襟见肘。这次我用STC89C52RC在Proteus 8.15里做了个4线…

阅读更多 →
Win10下VS2019编译OpenCV4.5.5与contrib:源码编译避坑指南 2026/9/29 17:16:07

Win10下VS2019编译OpenCV4.5.5与contrib:源码编译避坑指南

简介:针对Windows 10与Visual Studio 2019开发环境,这份预编译的OpenCV 4.5.5及contrib扩展库压缩包,可直接解决开发者自行编译时常见的CMake配置、依赖匹配和版本冲突问题,适合图像处理与计算机视觉方向的中高级工程师使用。包内…

阅读更多 →
6款降AIGC率工具实测:从原理到推荐,最终我只留这2款 2026/9/29 17:16:07

6款降AIGC率工具实测:从原理到推荐,最终我只留这2款

最近这半年,我算是把市面上能搜到的降AIGC率工具挨个测了个遍。前后加起来6款,有网页版、浏览器插件、在线平台,收费的和免费的都有。有的用了三次就删,有的付费续到现在还在用。经常在社区里看到“哪款降AIGC率工具好用”“英文免…

阅读更多 →
Java面试必考:面向对象设计题思路与图书借阅系统实现 2026/9/29 17:16:07

Java面试必考:面向对象设计题思路与图书借阅系统实现

看到这个标题,我第一反应是挺亲切的。Java面试圈里“面向对象设计题”几乎是必考环节,而标题里的“面相”大概率是笔误,应该是“面向对象”。这种题目乍看像是课后作业,实际上是面试官用来摸你底细的经典套路。今天我就以这道“设…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉