新闻详情

新闻详情

首页 / 资讯中心 / 详情

vLLM 搭配 LiteLLM:用 OpenAI 兼容格式调用本地模型服务(Chat 与 Embedding 实战)

发布时间:2026/9/5 20:06:17来源:尧图网络
vLLM 搭配 LiteLLM:用 OpenAI 兼容格式调用本地模型服务(Chat 与 Embedding 实战)
vLLM 搭配 LiteLLM用 OpenAI 兼容格式调用本地模型服务Chat 与 Embedding 实战【免费下载链接】vllmA high-throughput and memory-efficient inference and serving engine for LLMs项目地址: https://gitcode.com/GitHub_Trending/vl/vllmLiteLLM 是一个支持 OpenAI 统一格式调用各家 LLM API 的网关/适配层它可以把请求翻译到各供应商的completion、embedding、image_generation端点统一输出结构文本响应始终位于[choices][0][message][content]并提供跨多个部署的 Router 重试/回退逻辑以及按项目、API Key、模型粒度设置预算与限流的 Proxy ServerLLM Gateway能力。由于 vLLM 提供标准 OpenAI 兼容 APILiteLLM 原生支持 vLLM 上部署的全部模型——这意味着你可以把 vLLM 当作一个自建模型供应商用一套统一的代码同时对接 OpenAI、Azure、本地 vLLM 等多种后端。本文基于 docs/deployment/frameworks/litellm.md 讲解完整的部署与调用流程并结合 vLLM 源码说明 LiteLLM 实际打到的服务端点实现。环境准备准备工作非常直接在 Python 环境中同时安装 vLLM 与 litellmpip install vllm litellm安装后本地即可启动 vLLM 服务vllm serve而客户端代码只需引入litellm库即可发起请求。部署 vLLM 服务Chat Completion以 Qwen1.5 为例第一步用一个支持 chat completion 的模型启动 vLLM OpenAI 兼容 API 服务vllm serve qwen/Qwen1.5-0.5B-Chat从源码看vllm serve命令的入口在 vllm/entrypoints/cli/serve.py它最终调用 vllm/entrypoints/launchers/api_server/entry.py 中的setup_server/run_server拉起 FastAPI 应用服务默认监听端口为 8000见 vllm/entrypoints/launchers/cli_args.py 中port: int 8000可通过--port、--host调整。启动后服务暴露的聊天补全端点定义在 vllm/entrypoints/openai/chat_completion/api_router.py端点路径为POST /v1/chat/completions请求体由ChatCompletionRequest协议解析实际处理委托给OpenAIServingChat见 vllm/entrypoints/openai/chat_completion/serving.py 的create_chat_completion支持 JSON 一次性响应与 SSE 流式text/event-stream两种返回形式流式响应还带有可配置的sse_keep_alive_interval心跳机制。这正是 LiteLLM 的completion接口所对接的端点。Embeddings以 BGE 为例若需要向量嵌入能力则改用支持 embedding 的模型启动服务vllm serve BAAI/bge-base-en-v1.5对应服务端点实现位于 vllm/entrypoints/pooling/embed/api_router.py除 OpenAI 标准的/v1/embeddings外还额外提供了/v2/embedCohere 风格端点请求经EmbeddingRequest协议校验后由embedding(raw_request)句柄分发给具体 serving 实现vllm/entrypoints/pooling/embed/serving.py。使用 LiteLLM 调用1. 调用 Chat Completion关键点模型名必须带hosted_vllm前缀LiteLLM 用它识别自建 vLLM 服务这一供应商类型并把api_base指向 vLLM 服务的/v1路径import litellm messages [{content: Hello, how are you?, role: user}] # hosted_vllm 是必需的前缀关键字 response litellm.completion( modelhosted_vllm/qwen/Qwen1.5-0.5B-Chat, # 传 vLLM 中部署的模型名 messagesmessages, api_basehttp://{your-vllm-server-host}:{your-vllm-server-port}/v1, temperature0.2, max_tokens80, ) print(response)参数说明参数说明model必须形如hosted_vllm/{vLLM 部署的模型名}前缀不可省略api_basevLLM 服务的 base 地址注意结尾带/v1默认端口通常为 8000messagesOpenAI 标准消息列表格式temperature/max_tokens透传到 vLLM 的采样参数由于 LiteLLM 负责把各家协议统一翻译为 OpenAI 格式返回结果中response[choices][0][message][content]始终可稳定取到文本内容无需针对 vLLM 单独做响应解析。2. 调用 EmbeddingsEmbedding 调用的写法与 completion 略有不同api_base通过环境变量HOSTED_VLLM_API_BASE传入而非函数参数模型名同样需要hosted_vllm前缀from litellm import embedding import os os.environ[HOSTED_VLLM_API_BASE] http://{your-vllm-server-host}:{your-vllm-server-port}/v1 # hosted_vllm 是必需的前缀关键字传 vLLM 中部署的模型名 embedding embedding(modelhosted_vllm/BAAI/bge-base-en-v1.5, input[Hello world]) print(embedding)这里model中的模型名要与vllm serve BAAI/bge-base-en-v1.5启动时的模型名一致input为待嵌入的文本列表返回结构与 OpenAI/v1/embeddings响应一致data中携带向量。适用场景与小结这套组合的价值在于统一接口业务代码只用一套 LiteLLM 调用逻辑即可在后端替换时OpenAI 云端 ↔ 自建 vLLM只改动model前缀与api_base多部署容错借助 LiteLLM Router可将多个 vLLM 部署或多供应商配置为同一路由目标实现重试与 fallback网关级管控通过 LiteLLM Proxy Server 可在网关层按项目、API Key、模型做预算与限流适合多租户接入自建推理集群。排查要点调用失败时优先确认hosted_vllm前缀是否遗漏、api_base是否以/v1结尾、vLLM 服务端口默认 8000与模型名是否与vllm serve启动参数一致。更多 vLLM 部署框架集成可参考 docs/deployment/frameworks 目录下的其他文档如 Open WebUI、AnythingLLM、BentoML 等。【免费下载链接】vllmA high-throughput and memory-efficient inference and serving engine for LLMs项目地址: https://gitcode.com/GitHub_Trending/vl/vllm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

工厂自动化拆机工控配件回收:PLC、伺服驱动器、触摸屏评估与处置流程 2026/9/5 20:39:25

工厂自动化拆机工控配件回收:PLC、伺服驱动器、触摸屏评估与处置流程

工厂自动化改造一结束,仓库里往往多出几台旧PLC、伺服驱动器、触摸屏和电机。这些东西并不一定坏,只是不在新系统架构里用了。断电拆下来之后,往上堆灰可惜,当废品卖又觉得亏。这次我们就来整理一个很实际的处置方向:长…

阅读更多 →
C#蓝牙项目交付指南:从BlueTooth.rar到即用型桌面应用 2026/9/5 20:39:25

C#蓝牙项目交付指南:从BlueTooth.rar到即用型桌面应用

简介:本资源是一个基于C#开发的Windows 10平台PC端BLE通信工具源码包,面向物联网开发者、嵌入式与上位机协同开发初学者及低功耗蓝牙应用实践者,解决Windows环境下扫描、连接、服务发现与特征读写等核心BLE交互问题。压缩包共48个文件&#x…

阅读更多 →
C#蓝牙开发实战:从BlueTooth.rar解密Windows桌面端RFCOMM通信 2026/9/5 20:39:25

C#蓝牙开发实战:从BlueTooth.rar解密Windows桌面端RFCOMM通信

简介:本资源是一个基于C#开发的Windows 10平台PC端低功耗蓝牙(BLE)通信工具源码包,面向物联网开发者、嵌入式通信学习者及需实现PC与BLE设备交互的中高级C#程序员,解决Windows环境下BLE设备扫描、连接、服务发现与特征…

阅读更多 →
Ladybird 浏览器构建实战:多平台编译前置、ladybird.py 工作流与调试技巧 2026/9/5 20:39:25

Ladybird 浏览器构建实战:多平台编译前置、ladybird.py 工作流与调试技巧

Ladybird 浏览器构建实战:多平台编译前置、ladybird.py 工作流与调试技巧 【免费下载链接】ladybird Truly independent web browser 项目地址: https://gitcode.com/GitHub_Trending/la/ladybird 本文基于 Ladybird 仓库中的官方构建文档 Documentation/Bui…

阅读更多 →
基于MADDPG的多无人机协同围捕:从算法原理到PyTorch实战 2026/9/5 20:39:25

基于MADDPG的多无人机协同围捕:从算法原理到PyTorch实战

简介:本资源是一个面向人工智能与机器人方向研究者、高校师生及强化学习实践者的多无人机协同围捕仿真项目,聚焦于解决多智能体在动态环境中协同决策与目标围捕的核心挑战。项目基于MADDPG算法,在自定义Gymnasium仿真环境上训练3架无人机智能…

阅读更多 →
步进驱动器维修测试全流程:从故障分层到带载验收 2026/9/5 20:36:24

步进驱动器维修测试全流程:从故障分层到带载验收

设备维修里有一个很常见但容易被忽略的现象:同样报“驱动器故障”,直接拆机换功率管,往往越修越坏。步进驱动器和伺服驱动器一样,输入级、控制级、输出级和外围接线都可能让整机进入报警状态,而你判断的“坏”&#xf…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞