新闻详情

新闻详情

首页 / 资讯中心 / 详情

如何衡量长上下文RAG的质量与速度?RedKnot HotpotQA Demo实战:F1/EM/TTFT一次看全

发布时间:2026/9/29 15:50:13来源:尧图网络
如何衡量长上下文RAG的质量与速度?RedKnot HotpotQA Demo实战:F1/EM/TTFT一次看全
如何衡量长上下文RAG的质量与速度RedKnot HotpotQA Demo实战F1/EM/TTFT一次看全【免费下载链接】RedKnotEfficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention项目地址: https://gitcode.com/gh_mirrors/re/RedKnotRedKnot是一个构建在 SGLang 之上的长上下文 LLM 推理加速框架核心能力是Head-Aware KV 复用 SegPagedAttention。本篇教程带你用它自带的HotpotQA 长上下文 RAG Demo一次看全衡量长上下文 RAG 系统最关键的三类指标答案质量F1/EM、响应速度TTFT 首 Token 延迟、以及算力开销FLOPs。无需从零搭评测代码一条命令即可出报告 为什么选 HotpotQA 来衡量长上下文 RAGHotpotQA 的 distractor 设定天然适合 RAG 评测每道题给出多个段落其中只有少数段落包含真实答案其余都是干扰文档。RedKnot 的 Demoexamples/redknot/rag_redknot_demo.py正是把这个设定工程化了从 HotpotQA 的distractor配置中随机抽取样本把金文档 干扰文档拼装成N 个可复用文档段默认 6 段 × 5000 token约 30K 上下文让模型只用以上文档回答给出最短答案再自动判分。这模拟了真实 RAG 场景文档可跨请求复用、上下文很长、答案必须精准。3 个核心指标F1、EM、TTFT 各代表什么 质量指标F1 与 EM答案抽取式 QA 评测的行业标准就两个Demo 中直接内置了实现指标含义直觉理解F1预测答案与标准答案的词级 F1 分数部分答对也有分衡量接近程度EM(Exact Match)归一化后是否完全一致非 0 即 1衡量完全答对率评分前会做归一化去标点、去冠词、统一大小写见 normalize_answer 与 f1_score 实现。F1 看下限EM 看上限两个一起看才能判断加速方案是否偷偷降了质量。⚡ 速度指标TTFT首 Token 延迟长上下文场景下用户感知最强的就是等多久才蹦出第一个字。Demo 对每条样本分别计时baseline_ttft_sDense 基线全文拼接后一次性 prefill的首 Token 延迟redknot_online_ttft_sRedKnot 路径文档段离线预填好 KV在线只做位置无关的 KV 复用 问题前缀注意力的在线 TTFTwall_speedup两者相除的实测加速比。官方 README 给出的目标区间是热态下2–5× TTFT 加速同时质量回归控制在1 个百分点以内见 README.md。 保真度与算力Cosine 与 FLOPslogits_cosine/top1_match_rate/top10_overlap对比两条路径输出的 logit 分布数值越接近 1说明加速不改变模型行为baseline_flops/redknot_online_flops/flops_savings按注意力 FFN 解析估算的算力账本官方目标70–90% 算力节省。上图为 SGLang 侧 Batch 调度与 Prefill/Decode 流水线的示意RedKnot 的价值正是让Prefill 这一侧可以靠 KV 复用大幅缩短Decode 侧则几乎零改动。一键跑通HotpotQA Demo 实战步骤第 1 步环境准备git clone https://gitcode.com/gh_mirrors/re/RedKnot cd RedKnot pip install transformers datasets accelerate safetensors需要一个 CUDA GPU默认模型为 Qwen3-32B双卡即可冒烟测试可换Qwen3-0.6B 短段长单卡几分钟跑完。第 2 步运行 Demo论文风格的最小复现命令详见 examples/redknot/README.mdCUDA_VISIBLE_DEVICES0,1 python examples/redknot/rag_redknot_demo.py \ --model-path Qwen/Qwen3-32B \ --dataset hotpotqa/hotpot_qa --dataset-config distractor \ --split validation --n-samples 1 --n-segments 6 \ --tokens-per-segment 5000 \ --output /tmp/redknot_rag_demo.json不传--head-config时Demo 会自动生成一个简单策略约 15% 全局头 其余局部头、窗口 256足够快速验证链路是否跑通。第 3 步读懂输出 JSON结果落盘为结构化 JSONsummary字段就是一次看全的汇总表汇总逻辑源码{ summary: { baseline_f1: 0.5, redknot_f1: 0.5, baseline_ttft_s: 12.3, redknot_online_ttft_s: 5.6, flops_speedup: 2.1, flops_savings: 0.52 } }看报告的顺序建议先看 F1/EM 是否对齐 → 再看 TTFT 加速 → 最后核对 FLOPs 账本。三步都过才说明加速是干净的。进阶玩法更多入口与生产化组件想做什么去哪里16K4×4KQwen3-32B Sparse FFN 对比run_hotpot_4x4k.py报告 F1/EM/cosine/TTFT/FLOPsSegPagedAttention 微基准8K/32K/128K 延迟segpaged_redknot_demo.py完整 RAG 基准套件DeepSeek-V4-Flash 等test/srt/redknot/ 下的benchmark_RedKnot_*_RAG.py运行时核心机制头分类、SegPaged、Sparse FFNpython/sglang/srt/layers/attention/redknot/生产部署时RedKnot 也可作为独立 attention backend 直接挂到 SGLang 服务上python -m sglang.launch_server --attention-backend segpaged ...详见 examples/redknot/README.md。顺带一提如果你还想玩多模态SGLang 的 quick_start 示例 里就备好了这类测试图片和长上下文 RAG 一样即开即用。小结一张表记住如何衡量维度指标好的信号质量F1 / EM与 Dense 基线差 ≤ 1pp速度TTFT / wall_speedup热态 2–5× 加速保真logits cosine / top10 重叠≈ 1.0算力flops_savings70–90% 节省掌握这套质量—速度—算力三角验证法你就不只是跑通了一个 Demo而是学会了评估任何长上下文 RAG 加速方案的通用标尺【免费下载链接】RedKnotEfficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention项目地址: https://gitcode.com/gh_mirrors/re/RedKnot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

SpringBoot医药管理系统实战:从表结构设计到库存批次与销售核心实现 2026/9/29 16:53:27

SpringBoot医药管理系统实战:从表结构设计到库存批次与销售核心实现

大四那会儿我接过不少基于SpringBoot的毕业设计代做需求,医药管理系统是每年都会遇到的老面孔。一开始我以为这只是个普通的CRUD项目,真正动手后才发现,医药管理系统跟学生信息管理、商城系统完全不是一个量级——它涉及到库存批次、药品有效…

阅读更多 →
DeepSeek法律舆情智能分析与应对策略生成实战 2026/9/29 16:52:55

DeepSeek法律舆情智能分析与应对策略生成实战

简介:这是一份基于DeepSeek的法律舆情智能分析与应对策略生成方案PDF,核心是通过事件抽取技术完成法律热点事件脉络梳理与公关应对方案自动生成,面向NLP算法工程师、法律科技产品经理及舆情分析研究人员。全卷共709页、56个大章节&#xff0c…

阅读更多 →
AI资讯日报制作方法论:从信息筛选到工程化交付 2026/9/29 16:52:55

AI资讯日报制作方法论:从信息筛选到工程化交付

我无法基于当前输入生成符合要求的博文。原因在于:您提供的输入内容中,项目正文为空(仅显示了),关键词缺失具体信息(仅列出“最新网络热词”但未给出实际词汇),摘要描述完全空白&…

阅读更多 →
深度学习图像处理实战:从CNN选型到模型部署全解析 2026/9/29 16:52:28

深度学习图像处理实战:从CNN选型到模型部署全解析

1. 图像处理为什么开始依赖深度学习1.1 传统算法做了几十年,哪些场景仍然吃力我经常被问到一个问题:传统图像处理是不是要被深度学习淘汰了?我的回答通常是:不是淘汰,而是分工变了。入行十年,我从OpenCV的阈…

阅读更多 →
个人微信API二次开发:群控管理与私域社群运营系统设计 2026/9/29 16:52:28

个人微信API二次开发:群控管理与私域社群运营系统设计

官方文档:GeWe API - GeWe API|微信 API 开发文档 一、业务痛点与技术背景 社群运营高频能力:建群、邀人、踢人、公告、关键词回复、违规治理、活跃统计。痛点在于: 群事件与消息回调混杂,规则引擎易误伤 多群广播无…

阅读更多 →
OpenClaw 本地 AI 智能体新范式:TaoToken 统一 Key 接入与技能插件化配置实战 2026/9/29 16:52:21

OpenClaw 本地 AI 智能体新范式:TaoToken 统一 Key 接入与技能插件化配置实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉