新闻详情

新闻详情

首页 / 资讯中心 / 详情

10分钟跑通大模型推理性能测试:vLLM 吞吐量压测脚本完整指南

发布时间:2026/9/2 22:15:18来源:尧图网络
10分钟跑通大模型推理性能测试:vLLM 吞吐量压测脚本完整指南
10分钟跑通大模型推理性能测试vLLM 吞吐量压测脚本完整指南【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llm部署开源大模型时你最先卡住的问题往往是这台机器到底跑这个模型有多快选 vLLM 还是原生 Transformers差距有多少本文带你用vLLM 吞吐量压测benchmark_throughput官方自带基准测试脚本十分钟拿到 requests/s、tokens/s 指标让感觉挺快变成可对比的数字。关键指标速览 吞吐量Throughput单位时间内模型处理的数据总量分请求数和 token 数两种口径requests/s每秒完成多少条提示词请求衡量服务能扛多少并发tokens/s每秒处理多少 token含输入输出衡量计算总效率输入/输出长度压测时人为固定的 prompt 长度和生成长度决定单次请求的负载对比基线同一脚本支持vllm、hfHuggingFace Transformers两个后端同一台机器跑两次即可量化加速比图不同大模型在各类基准测试上的表现对比吞吐测试解决的是跑得多快这类榜单解决答得多好从零跑通第一次测试环境准备你只需要一台有 NVIDIA GPU 的机器仓库示例中 7B 模型用 RTX 3090 即可装好 vLLMpip install vllm git clone https://gitcode.com/GitHub_Trending/se/self-llm cd self-llm压测脚本已放在仓库的 models/Qwen2/benchmark_throughput.py把它拷到你的模型目录旁边即可。执行测试以 Qwen2-7B-Instruct 为例一条命令跑起 vLLM 后端压测python benchmark_throughput.py \ --model /root/autodl-tmp/qwen/Qwen2-7B-Instruct \ --backend vllm \ --input-len 64 \ --output-len 128 \ --num-prompts 25 \ --max-model-len 512关键参数说明--model模型本地路径--input-len/--output-len固定每条请求的输入和输出长度--num-prompts测试样本数首次跑用 25 足够图压测前先在镜像/框架层面确认 PyTorch 与 CUDA 版本匹配想量化加速比把--backend vllm改成--backend hf并加上--hf-max-batch-size 25再跑一次即可。仓库里 Qwen2 的 vLLM 部署教程 有完整对照流程。看懂输出结果脚本跑完会打印一行核心结果Throughput: 7.68 requests/s, 1474.75 tokens/s新版 vLLM 的脚本会输出三个值各字段含义对照如下指标含义健康参考值requests/s每秒完成的请求数7B 模型消费级显卡上5~30长度越短越高total tokens/s输入输出 token 总吞吐同硬件 7B 模型约 1000~6000随长度翻倍变化output tokens/s模型净生成速度通常约为 total 的 1/1.5~1/2 区间仓库实测数据同一块卡上 Qwen2-7B 走 vLLM 是 7.68 requests/s走 hf 后端只有 5.73 requests/svLLM 快约 34%DeepSeek-R1-Distill-Qwen-7B 短文本场景甚至跑到 29.34 requests/s。判断你的结果是否合理看同后端、同长度下的量级即可。踩坑与排障 显存不够OOM应对先降--num-prompts再调小--input-len/--output-lenvLLM 默认占 90% 显存可用--gpu-memory-utilization 0.8留出余量。两次结果波动很大应对固定--seed把--num-prompts加到 50 以上跑之前nvidia-smi确认没有别的进程占着 GPU。hf 后端直接报错应对--hf-max-batch-size只对 hf 后端生效但必填漏了脚本会直接抛错反之 vllm 后端传了它也会报错别混着抄命令。图显存紧张时换一张大显存的卡是比降并发更直接的解法收个尾一条benchmark_throughput.py命令就能拿到 requests/s 与 tokens/s无需自己写压测代码同机器、同长度下对比vllm和hf两个后端加速比一目了然指标要固定长度、固定 seed、固定样本数才可比别拿不同配置的数硬比7B 模型单卡即可压测先跑短文本64/128定位瓶颈再测长文本现在就选一个你部署过的模型把上面的命令填上路径跑一遍明天对比推理引擎时你就有数据说话了。【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

【原创】基于微信小程序+AI大模型+uni-app的节日礼品定制商城小程序(设计与实现) 2026/9/3 0:06:46

【原创】基于微信小程序+AI大模型+uni-app的节日礼品定制商城小程序(设计与实现)

摘要:随着电子商务与本地生活服务的普及,线上交易与店铺运营管理已成为常规业态。传统分散式进销存与人工对账方式存在流程割裂、库存难同步、促销规则难落地、经营数据难沉淀等弊端,难以支撑一体化的数字化运营。同类课题亦多见多商户在线商…

阅读更多 →
【原创】基于AI大模型+SpringBoot+Vue的宠物用品商城(设计与实现) 2026/9/3 0:06:46

【原创】基于AI大模型+SpringBoot+Vue的宠物用品商城(设计与实现)

摘要:随着电子商务与本地生活服务的普及,线上交易与店铺运营管理已成为常规业态。传统分散式进销存与人工对账方式存在流程割裂、库存难同步、促销规则难落地、经营数据难沉淀等弊端,难以支撑一体化的数字化运营。同类课题亦多见多商户在线商…

阅读更多 →
【原创】基于微信小程序+AI大模型+uni-app的宠物用品商城小程序(设计与实现) 2026/9/3 0:06:46

【原创】基于微信小程序+AI大模型+uni-app的宠物用品商城小程序(设计与实现)

摘要:随着电子商务与本地生活服务的普及,线上交易与店铺运营管理已成为常规业态。传统分散式进销存与人工对账方式存在流程割裂、库存难同步、促销规则难落地、经营数据难沉淀等弊端,难以支撑一体化的数字化运营。同类课题亦多见多商户在线商…

阅读更多 →
王者万象棋排位模式后三位扣分规则介绍 万象棋排位扣分怎么算 2026/9/3 0:03:44

王者万象棋排位模式后三位扣分规则介绍 万象棋排位扣分怎么算

王者万象棋的排位模式有一套独特的段位和扣分机制。其中王者万象棋排位模式后三位扣分怎么算,是很多玩家在排位上分过程中遇到的问题。王者万象棋排位模式后三位扣分的规则涉及段位保护、组队结算和阶梯式扣分几个方面。这篇攻略就详细拆解,想要获得更好…

阅读更多 →
打工人福音|OpenClaw 小龙虾 AI Windows 端部署 + 现成测试指令 2026/9/3 0:03:44

打工人福音|OpenClaw 小龙虾 AI Windows 端部署 + 现成测试指令

🦞实测|OpenClaw 小龙虾 AI Windows3.1.0 本地智能体,解压即用部署实录 适配版本:Windows 3.1.0|Mac 2.7.9 安装包大小:45.8MB 标签:#OpenClaw #小龙虾 AI #本地 Agent #AI 办公自动化 #开源 AI…

阅读更多 →
实测 OpenClaw 一键包,5 分钟完成本地自动化环境搭建 2026/9/3 0:03:44

实测 OpenClaw 一键包,5 分钟完成本地自动化环境搭建

OpenClaw 本地 AI 自动化工具部署指南|使用一键包规避环境配置难题 痛点:部署 AI 自动化工具常常要处理 Python、Node.js 各类依赖,版本冲突、环境配置耗费大量时间,OpenClaw 提供一键安装包,降低部署门槛。 适配系统&…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞