新闻详情

新闻详情

首页 / 资讯中心 / 详情

如何用 --no-optimize 基线与优化运行对比测量 Headroom 压缩对本地模型 prefill 的影响

发布时间:2026/9/9 22:31:26来源:尧图网络
如何用 --no-optimize 基线与优化运行对比测量 Headroom 压缩对本地模型 prefill 的影响
如何用 --no-optimize 基线与优化运行对比测量 Headroom 压缩对本地模型 prefill 的影响【免费下载链接】headroomCompress tool outputs, logs, files, and RAG chunks before they reach the LLM. 20% fewer tokens for coding agents, 60-95% fewer tokens for JSON, same answers. Library, proxy, MCP server.项目地址: https://gitcode.com/GitHub_Trending/head/headroom本地模型不按 token 计费但每次 prompt token 都实打实地消耗在 prefill 上——在 Apple Silicon 等本地推理环境里长会话的 coding agent 往往瓶颈就在 prompt 处理而不是生成速度。本文的操作是用同一个任务分别跑一次--no-optimize基线和一次开启优化的运行通过 proxy dashboard 的 before/after token 计数量化 Headroom 压缩减少了多少发往本地模型的 prompt token。前提是本地模型服务提供 OpenAI 兼容接口接受/v1/chat/completions或/v1/responses例如 MLX/OMLX、vLLM、LM Studio、Ollama 的 OpenAI-compatible endpoint。完整流程见 Local LLM Prefill Benchmark。准备本地推理服务与 Headroom 安装先启动你的本地 OpenAI 兼容模型服务。本文档假定它监听在http://127.0.0.1:8000下文所有命令按这一地址书写如果你的服务端口或地址不同替换对应值即可pip install headroom-ai[proxy]--no-optimize是headroom proxy的内置选项默认false作用是 Disable optimization (passthrough mode)即代理只做流量转发、不做任何压缩。选项说明见 Proxy Server 文档 的 CLI options 表。第一步--no-optimize 基线运行以优化禁用的方式启动 Headroom作为透明代理headroom proxy \ --port 8787 \ --openai-api-url http://127.0.0.1:8000 \ --no-optimize把 agent 或应用的指向从本地服务改到 Headroom 代理export OPENAI_BASE_URLhttp://127.0.0.1:8787/v1 export OPENAI_API_KEYlocal然后跑一个真实的任务。文档建议选择 coding-agent 的 refactor 类任务作为基准因为这类任务会产生重复的文件读取、工具结果、lint/测试输出和不断增长的会话上下文。运行期间打开 dashboard 观察headroom dashboard --port 8787 --no-open # 或直接打开 http://127.0.0.1:8787/dashboard记录基线 session 的 token 总数。判断基线是否可信有一个文档给出的检查点在--no-optimize下before 和 after 的 token 计数应当一致因为 Headroom 此时只是转发流量。两次运行之间重置基准状态第二次运行前必须重置基准状态否则两次结果不可比。文档列出的重置条件是回滚第一次运行造成的代码或数据变更coding-agent 测试中干净的 git worktree 是最简单的重置点开一个新的 agent session使用相同的模型和本地服务使用相同的 prompt不改动无关的 flag 或服务端设置第二步不带 --no-optimize 的优化运行重启 Headroom去掉--no-optimizeheadroom proxy \ --port 8787 \ --openai-api-url http://127.0.0.1:8000用相同的OPENAI_BASE_URL和 prompt 再跑一次同一任务在 dashboard 上观察该 session 的 before/after token 计数。这里的 savings 百分比是发往本地模型的 prompt token 减少量。需要注意它的含义边界这不会让模型的 prefill kernel 本身变快而是减少了 kernel 需要处理的 prompt 量。可选带 --learn 学习的运行拿到基线后可以把启用学习作为第三个独立条件来测headroom proxy \ --port 8787 \ --openai-api-url http://127.0.0.1:8000 \ --learn--learn隐含启用 memory让 Headroom 从 proxy session 中学习重复出现的流量模式。文档要求把它当作独立的 benchmark 条件处理passthrough、optimized、optimized-with-learning 三种运行分别对比不要混在一起归因。记录与解读基准结果一份可用的本地 prefill 基准报告文档给出的字段如下FieldExampleLocal serverMLX, vLLM, LM Studio, Ollama-compatible endpointModellocal model name and quantization, if relevantHardwareMac model, RAM, or GPU/CPU targetAgent/clientcoding agent or app nameTaskshort description of the repeated taskBaseline tokensdashboard before/after total with--no-optimizeOptimized tokensdashboard before/after total without--no-optimizeSavingsdashboard percentageNoteswhether--learn,--memory, or other flags were enabled解读时有两个文档明确给出的判断依据本地模型与托管 API 的价值不同托管 API 下减少输入 token 通常意味着更低的成本和延迟本地模型下减少输入 token 主要意味着更少的 prefill 工作和更低的内存压力。长会话的 agent 任务通常比短对话轮次收益更大因为重复的文件读取、工具输出和日志会产生更多可压缩上下文如果任务以短自然语言轮次为主预期收益更小。最后一条是文档强调的对比纪律不要用冷启动的第一次运行去对比已经热身的第二次运行再把全部改善归因于压缩。保持服务、模型、prompt 和 agent 任务稳定以 dashboard 的 token 计数作为主要测量口径。【免费下载链接】headroomCompress tool outputs, logs, files, and RAG chunks before they reach the LLM. 20% fewer tokens for coding agents, 60-95% fewer tokens for JSON, same answers. Library, proxy, MCP server.项目地址: https://gitcode.com/GitHub_Trending/head/headroom创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Flink核心概念与实战:状态、时间语义、Checkpoint全解析 2026/9/9 23:07:34

Flink核心概念与实战:状态、时间语义、Checkpoint全解析

干了这么多年实时计算,我越来越觉得Flink已经不只是“一个框架”这么简单,它基本把流处理这件事变成了行业默认标准。不管是实时数仓、实时风控、用户画像,还是简单的数据同步,面试和实际开发里绕不开的都是它。这篇文章是我梳理F…

阅读更多 →
无需训练模型,几秒音频就能复刻声音:OpenVoice 语音克隆快速上手指南 2026/9/9 23:07:34

无需训练模型,几秒音频就能复刻声音:OpenVoice 语音克隆快速上手指南

无需训练模型,几秒音频就能复刻声音:OpenVoice 语音克隆快速上手指南 【免费下载链接】OpenVoice Instant voice cloning by MIT and MyShell. Audio foundation model. 项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice 想让 AI 用某…

阅读更多 →
为 Selenium .NET 绑定新增与移除 Chromium DevTools Protocol 版本:DevTools 版本化维护操作指南 2026/9/9 23:07:34

为 Selenium .NET 绑定新增与移除 Chromium DevTools Protocol 版本:DevTools 版本化维护操作指南

为 Selenium .NET 绑定新增与移除 Chromium DevTools Protocol 版本:DevTools 版本化维护操作指南 【免费下载链接】selenium A browser automation framework and ecosystem. 项目地址: https://gitcode.com/GitHub_Trending/se/selenium 本文以仓库内 dotn…

阅读更多 →
OutputShader 实战解析:为 three.js 后期处理链加入色调映射与色彩空间转换 2026/9/9 23:07:34

OutputShader 实战解析:为 three.js 后期处理链加入色调映射与色彩空间转换

OutputShader 实战解析:为 three.js 后期处理链加入色调映射与色彩空间转换 【免费下载链接】three.js JavaScript 3D Library. 项目地址: https://gitcode.com/GitHub_Trending/th/three.js 本文聚焦 three.js 的 addon 着色器模块 OutputShader。它是一段可…

阅读更多 →
Qt与snap7西门子PLC通信实战:从环境搭建到现场排错 2026/9/9 23:07:34

Qt与snap7西门子PLC通信实战:从环境搭建到现场排错

简介:面向工业自动化软件开发人员,这套Qt结合Snap7的示例工程包,用于实现西门子PLC(S7系列)通信,可解决桌面应用与PLC数据交互、远程监控与控制等实际问题。压缩包共8个文件,主要包含2个C源文件…

阅读更多 →
STM32串口DMA不定长接收:从原理到HAL库实战 2026/9/9 23:04:34

STM32串口DMA不定长接收:从原理到HAL库实战

简介:STM32串口通信DMA例程是一份面向嵌入式开发者与STM32初学者的完整工程资源,围绕USART、DMA与空闲中断的结合,解决大量数据收发时CPU占用过高的问题,提升系统实时性。资源共793个文件,整体约35.8MB,以C…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞