新闻详情

新闻详情

首页 / 资讯中心 / 详情

Unified Cache Manager(UCM)SGLang集成指南:3步开启跨请求KV Cache持久化共享

发布时间:2026/9/25 4:06:46来源:尧图网络
Unified Cache Manager(UCM)SGLang集成指南:3步开启跨请求KV Cache持久化共享
Unified Cache ManagerUCMSGLang集成指南3步开启跨请求KV Cache持久化共享【免费下载链接】unified-cache-managementUnified Cache Manager推理记忆数据管理器是一款以KV Cache为中心的推理加速套件其融合了多类型缓存加速算法工具分级管理并持久化推理过程中产生的KV Cache记忆数据扩大推理上下文窗口以实现高吞吐、低时延的推理体验降低每Token推理成本。项目地址: https://gitcode.com/ModelEngine/unified-cache-managementUnified Cache ManagerUCM推理记忆数据管理器是一款以KV Cache为中心的推理加速套件能够将推理过程中产生的 KV Cache 记忆数据分级持久化存储并通过检索复用替代重复计算。本指南带你3 步完成 UCM 与 SGLang 的集成开启跨请求、跨实例的 KV Cache 持久化共享让多轮对话与长上下文推理显著提速降低每 Token 推理成本。传统部署中每个 SGLang 推理实例各自持有一份独立的 KV Cache图中左侧的 Decentralized KVCache相同前缀的请求到了不同实例就要重新计算而接入 UCM 后KV Cache 被统一写入集中式存储图中右侧的 Centralized KVCache任意实例都能命中历史缓存这正是跨请求 KV Cache 持久化共享的价值所在。一、UCM 是什么为什么适合 SGLangUCM 采用分层架构向上通过 Integration 层以插件形式对接 vLLM、SGLang、MindIE 等推理引擎向下通过 Store 层适配多种存储后端中间提供 Prefill/Decode 加速能力如 Prefix Cache、稀疏注意力等。对 SGLang 而言UCM 的价值可以概括为三点持久化共享KV Cache 落盘到集中存储实例重启、扩容后历史缓存不丢失零拷贝读写基于 HiCache 的batch_get_v1/batch_set_v1零拷贝接口降低存储 I/O 开销免改代码无需修改 SGLang 业务代码通过配置项即可启用。二、集成原理UCM 如何接入 SGLang 的 HiCacheUCM 通过实现 SGLang HiCache 的L3 存储后端接口来接入适配补丁 sglang-adapt.patch 向 SGLang 的StorageBackendFactory注册unifiedcache后端并启用零拷贝的page_get/page_set路径Python 侧由 unifiedcache_store.py 中的UnifiedCacheStore类承载读/写请求ucm_connector.py 中的SglangUcmConnector负责把 SGLang 的 Host KV Pool 映射为 UCM 存储配置自动计算page_size、block_size、device_id等参数最终落到UcmPipelineStore存储管线见上图架构。 前置要求SGLang v0.5.9CUDA 平台。三、3 步开启跨请求 KV Cache 持久化共享Step 1安装 UCM三选一推荐 Docker方式 A官方预构建镜像最快docker pull unifiedcachemanager/ucm-sglang:latest docker run --rm --gpus all --networkhost --ipchost \ -v path_to_your_models:/home/model \ -v path_to_your_storage:/home/storage \ --name name_of_your_container \ -it unifiedcachemanager/ucm-sglang:latest--ipchost用于保证共享内存足够大不可省略。方式 B从源码构建镜像git clone --depth 1 --branch branch_or_tag_name https://gitcode.com/ModelEngine/unified-cache-management cd unified-cache-management docker build -t ucm-sglang:latest -f ./docker/Dockerfile.ucm-sglang-cuda-v0.5.5 ./Dockerfile 会自动调用 build_sglang.sh 编译 wheel、安装依赖并应用 SGLang 集成补丁。方式 Cpip 安装在 SGLang 官方镜像环境内执行export PLATFORMcuda pip install uc-managerStep 2配置 KV Cache 持久化共享核心配置UCM 配置以 JSON 格式通过--hicache-storage-backend-extra-config传入 SGLangHICACHE_CONFIG{ backend_name:unifiedcache, module_path:ucm.integration.sglang.unifiedcache_store, class_name:UnifiedCacheStore, interface_v1:1, kv_connector_extra_config:{ ucm_connector_name:UcmPipelineStore, ucm_connector_config:{ storage_backends:/mnt/test } } }⚠️ 请把/mnt/test替换为你的实际存储目录多个目录可用冒号分隔。也可以将上述kv_connector_extra_config写入 YAML 文件并通过环境变量UNIFIEDCACHE_CONFIG_FILE指定免去每次拼 JSON 的麻烦。Step 3启动推理服务验证缓存命中启动 OpenAI 兼容在线服务python3 -m sglang.launch_server \ --model-path your_model_path \ --tensor-parallel-size 2 \ --page-size 128 \ --port 7800 \ --trust-remote-code \ --enable-hierarchical-cache \ --hicache-mem-layout page_first \ --hicache-write-policy write_through \ --hicache-storage-backend dynamic \ --hicache-storage-prefetch-policy wait_complete \ --hicache-storage-backend-extra-config $HICACHE_CONFIG看到Application startup complete.日志即启动成功随后可直接调用 APIcurl http://localhost:7800/v1/completions \ -H Content-Type: application/json \ -d {model: your_model_path, prompt: Hello!, max_tokens: 64, temperature: 0}离线批量推理同样的分层缓存参数也可直接传给 SGLang 的offline_batch_inference.py示例脚本无需任何 UCM 专属代码改动。四、关键参数速查与常见问题参数作用建议值--enable-hierarchical-cache开启 SGLang 分层缓存HiCache必选--hicache-mem-layoutHost 内存池布局page_firstUCM 强制要求--hicache-write-policy缓存写策略write_through--hicache-storage-backend存储后端类型dynamic动态加载 UCM 插件storage_backendsKV Cache 持久化目录建议指向高速盘或共享存储常见问题报错 requires --hicache-mem-layout page_firstUnifiedCacheStore仅支持 page_first 布局请检查启动参数。缓存不生效确认backend_name为unifiedcache、module_path拼写正确且 SGLang 版本已应用适配补丁。需要更大的 KV Cache 容量可参考项目内 KV Cache 容量计算器评估显存/内存需求。五、总结通过安装 → 配置 → 启动三步你已在 SGLang 上开启了由Unified Cache ManagerUCM驱动的跨请求 KV Cache 持久化共享相同前缀的重复请求将被集中存储命中重复 Prefill 计算被显著减少吞吐与时延表现随之改善。更多细节可查阅官方文档SGLang 快速上手quickstart_sglang.mdSGLang 集成源码ucm/integration/sglang/前缀缓存最佳实践user-guide/prefix-cache/支持矩阵support_matrix.md【免费下载链接】unified-cache-managementUnified Cache Manager推理记忆数据管理器是一款以KV Cache为中心的推理加速套件其融合了多类型缓存加速算法工具分级管理并持久化推理过程中产生的KV Cache记忆数据扩大推理上下文窗口以实现高吞吐、低时延的推理体验降低每Token推理成本。项目地址: https://gitcode.com/ModelEngine/unified-cache-management创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

智慧水务可视化方案PPT全解析:从指标拆解到ECharts大屏 2026/9/25 5:19:10

智慧水务可视化方案PPT全解析:从指标拆解到ECharts大屏

简介:这套基于可视化的智慧水务解决方案PPT,面向水务企业信息化管理者、智慧城市项目规划人员及行业培训讲师,系统阐释如何运用物联网、大数据和云计算构建智慧水务体系,解决供水调度、数据整合及业务协同等常见痛点。资料包内共1…

阅读更多 →
PaddleSpeech ErnieLinear 标点恢复模型:从 API 结构到训练、推理与源码剖析 2026/9/25 5:19:04

PaddleSpeech ErnieLinear 标点恢复模型:从 API 结构到训练、推理与源码剖析

人工智能语音音频 【免费下载链接】PaddleSpeech Easy-to-use Speech Toolkit including Self-Supervised Learning model, SOTA/Streaming ASR with punctuation, Streaming TTS with text frontend, Speaker Verification System, End-to-End Speech Translation and Keyword…

阅读更多 →
产品特性与过程特性分类管理:从失效分级到控制计划落地 2026/9/25 5:19:04

产品特性与过程特性分类管理:从失效分级到控制计划落地

简介:这是一份面向质量管理、产品开发及过程评审人员的产品特性与过程特性分类管理办法PDF,用于解决汽车及零部件行业在APQP/PPAP中如何识别、分级、标注特殊特性的问题。文档明确了产品特性、过程特性、特殊特性等术语,规定产品部、项目小组…

阅读更多 →
【Dify】记忆测试应用 2026/9/25 5:18:58

【Dify】记忆测试应用

认知力和记忆能力评估是编程自学者常见的需求。高效、自动化的记忆测试系统能够为不同学习和训练场景提供更科学的解决方案。 本文介绍Dify记忆测试工作流的结构与应用方法,涵盖核心模型设计、流程节点设置、典型应用案例,帮助理解其在认知评估和能力训练中的价值。 文章目录…

阅读更多 →
程序遇到问题错误bug时的19种解决方法途径总结以及之前的一些具体例子 2026/9/25 5:18:58

程序遇到问题错误bug时的19种解决方法途径总结以及之前的一些具体例子

目录 1 信心--没有解决不了的bug 2 耐心、不要着急、静下心来、用脑思考 2.1 开始解决问题前不要着急,先思考 2.2 在解决问题的过程中也不要着急,要冷静思考 3 灵活运用、不要局限或痴迷于某一种方法 4 不要经验主义、不要局限于以前的经验或者知识…

阅读更多 →
golutra安装与下载指南:Windows/macOS/Linux三平台3分钟配置多智能体工作台 2026/9/25 5:18:58

golutra安装与下载指南:Windows/macOS/Linux三平台3分钟配置多智能体工作台

golutra安装与下载指南:Windows/macOS/Linux三平台3分钟配置多智能体工作台 【免费下载链接】golutra Multi-agent AI orchestration platform for automation, workflows, and developer tools. Golutra transforms Codex, Claude Code, and OpenClaw into a unifi…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉