新闻详情

新闻详情

首页 / 资讯中心 / 详情

Qwen-Image-2.1 本地部署与 API 服务发布实战

发布时间:2026/9/27 22:58:09来源:尧图网络
Qwen-Image-2.1 本地部署与 API 服务发布实战
文章目录一、部署环境二、工具选型三、模型选型四、下载与目录五、启动脚本六、接口和局域网调用七、实战效果八、几点提醒Qwen-Image-2.1 是通义千问 9 月 20 日放出来的开源图像模型权重能直接下载生成组件 7B官方默认出图 2048×2048。我这边一直想把生图接到自己的 Agent 里走云端接口按张计费量一上来账就不好看于是琢磨着把它放到本地那台 3060 上自己跑。这次的目标不只是出图还要让它常驻成一套能被程序调用的 HTTP 服务。今天把部署的过程和踩到的坑整理了一下感兴趣的可以接着往下看。一、部署环境先看这台机器的家底。项目配置操作系统Windows 64 位处理器Intel Core i5-13490F内存32GB显卡NVIDIA GeForce RTX 3060显存12GB推理后端CUDA 12图这台机器的实际配置整台机器里最紧的就是那张 12GB 的卡。官方 BF16 权重全驻留要 33GB 显存起步光文本编码器就比生成模型本身还大这块卡连门都进不去。**这次部署的目标是让 12GB 显存跑通并稳定出图不是把权重全塞进显卡。**所以模型选型我走的就是量化这条路。二、工具选型本地运行生图模型我找了几个方案llama.cpp运行的是 Qwen3.8、DeepSeek 这类语言模型虽然用的都是 GGUF 是模型文件格式但不代表所有 GGUF 都能通过 llama.cpp 运行。ComfyUI生态最全界面点几下就能出图代价是节点、插件和 Python 环境整套都得装齐要求比较高。stable-diffusion.cpp一个压缩包解压就能用自带命令行和一个网页界面还能直接对外开 HTTP 服务。我最后选的是 stable-diffusion.cpp因为这次要的是能被程序调用的服务端口。图官方 release 里挑对应后端的包我下的是 sd-master-88411ef-bin-win-cuda12-x64.zip318MB解压出来的文件夹是 sd-88411ef-bin-win-cuda12-x64。上面那个带 cudart 的是 CUDA 运行时依赖机器上有没有装 CUDA决定你要不要一起下。三、模型选型ModelScope 上的 Abiray 把 Qwen-Image-2.1 转成了 GGUF模型很全包含了 Q3 - Q8 的量化模型文件。图量化档位与建议显存对照我一开始想上 Q6_K5.88GB建议显存 10-12GB看着正好卡在这块卡的上限。除了主模型之外这台机器还要同时装下 8B 的文本编码器、mmproj 和 VAE这几样才是容易漏算的部分算了一下发现显存不够用。最后选了 Q4_K_M4.19GB建议显存 6-8GB给其他组件腾出了一截空间。这一档是拿画质余量换来的显存。四、下载与目录Qwen-Image-2.1 想跑起来要四个文件少一个都起不来。文件作用精度qwen_image_2.1_Q4_K_M.gguf图片生成主干Q4_K_MQwen3VL-8B-Instruct-Q4_K_M.gguf文本编码器读懂提示词Q4_K_Mmmproj-Qwen3VL-8B-Instruct-Q8_0.gguf视觉投影让编码器能读图Q8_0qwen_image_2.1_vae_bf16.safetensorsVAE把潜变量还原成图BF16下载我用的是 ModelScope 的命令行工具进到 models 目录里直接拉modelscope download--modelAbiray/Qwen-Image-2.1-GGUF qwen_image_2.1_Q4_K_M.gguf--local_dir./Qwen-Image-2.1 modelscope download--modelQwen/Qwen3-VL-8B-Instruct-GGUF Qwen3VL-8B-Instruct-Q4_K_M.gguf--local_dir./Qwen3-VL-8B-Instruct modelscope download--modelQwen/Qwen3-VL-8B-Instruct-GGUF mmproj-Qwen3VL-8B-Instruct-Q8_0.gguf--local_dir./Qwen3-VL-8B-Instruct–local_dir 后面跟的是落盘目录写相对路径会落到当前所在的文件夹所以下之前先切到 models 里别在根目录直接下。图命令行下载主模型图文本编码器来自 Qwen3-VL 的 GGUF 仓库图mmproj 下载中VAE 在官方模型仓库里文件名 qwen_image_2.1_vae_bf16.safetensors单独放一个 vae 子目录名字不改。五、启动脚本程序目录和模型目录我特意分开摆稳定运行之后结构是这个样子。图部署根目录的文件结构Qwen-image-2.1.bat 是测试生图用的脚本Qwen-image-edit.bat 是用来测试改图用的脚本都是测试阶段用的正在对外提供服务器的是 qwen-server.bat 脚本命令如下E:\.stable-diffusion.cpp\ ├── sd-88411ef-bin-win-cuda12-x64\ 程序含 sd-server.exe └── models\ ├── Qwen-Image-2.1\ │ ├── qwen_image_2.1_Q4_K_M.gguf │ └── vae\qwen_image_2.1_vae_bf16.safetensors └── Qwen3-VL-8B-Instruct\ ├── Qwen3VL-8B-Instruct-Q4_K_M.gguf └── mmproj-Qwen3VL-8B-Instruct-Q8_0.gguf这么摆的好处是升级程序的时候不用挪几十 GB 的模型文件换个程序文件夹就行。真正启动服务的是脚本最后那一段echo off chcp 65001 nul title Qwen-Image-2.1 API Server REM REM Qwen-Image-2.1 API Server REM stable-diffusion.cpp commit: 88411ef REM GPU: RTX 3060 12GB REM REM Root set ROOTE:\.stable-diffusion.cpp REM stable-diffusion.cpp set SD_DIR%ROOT%\sd-88411ef-bin-win-cuda12-x64 REM Qwen-Image-2.1 set DIFFUSION_MODEL%ROOT%\models\Qwen-Image-2.1\qwen_image_2.1_Q4_K_M.gguf REM Qwen3-VL set LLM_MODEL%ROOT%\models\Qwen3-VL-8B-Instruct\Qwen3VL-8B-Instruct-Q4_K_M.gguf set LLM_VISION%ROOT%\models\Qwen3-VL-8B-Instruct\mmproj-Qwen3VL-8B-Instruct-Q8_0.gguf REM VAE set VAE_MODEL%ROOT%\models\Qwen-Image-2.1\vae\qwen_image_2.1_vae_bf16.safetensors REM REM Server REM 0.0.0.0 Allow LAN access REM set LISTEN_IP0.0.0.0 set LISTEN_PORT1234 REM REM Check files REM echo. echo echo Checking files... echo echo. if not exist %SD_DIR%\sd-server.exe ( echo [ERROR] sd-server.exe not found: echo %SD_DIR%\sd-server.exe pause exit /b 1 ) if not exist %DIFFUSION_MODEL% ( echo [ERROR] Diffusion model not found: echo %DIFFUSION_MODEL% pause exit /b 1 ) if not exist %LLM_MODEL% ( echo [ERROR] LLM model not found: echo %LLM_MODEL% pause exit /b 1 ) if not exist %LLM_VISION% ( echo [ERROR] LLM Vision model not found: echo %LLM_VISION% pause exit /b 1 ) if not exist %VAE_MODEL% ( echo [ERROR] VAE model not found: echo %VAE_MODEL% pause exit /b 1 ) echo [OK] sd-server.exe echo [OK] Diffusion Model echo [OK] LLM Model echo [OK] LLM Vision echo [OK] VAE echo. REM REM Start Server REM cd /d %SD_DIR% echo echo Qwen-Image-2.1 API Server echo echo. echo Server: echo http://127.0.0.1:%LISTEN_PORT% echo. echo LAN: echo http://YOUR-LAN-IP:%LISTEN_PORT% echo. echo Diffusion: echo %DIFFUSION_MODEL% echo. echo LLM: echo %LLM_MODEL% echo. echo Vision: echo %LLM_VISION% echo. echo VAE: echo %VAE_MODEL% echo. echo echo Starting server... echo echo. sd-server.exe ^ --listen-ip %LISTEN_IP% ^ --listen-port %LISTEN_PORT% ^ --diffusion-model %DIFFUSION_MODEL% ^ --llm %LLM_MODEL% ^ --llm_vision %LLM_VISION% ^ --vae %VAE_MODEL% ^ --offload-to-cpu ^ --diffusion-fa ^ --vae-tiling echo. echo echo Server stopped. echo echo. pause前面那几行 set 全是给路径起变量主要是为了以后改目录的时候不用满脚本翻找。真正决定跑不跑得动的是最后三个参数。参数作用–offload-to-cpu把放不下、也不必一直占显存的部分交给内存–diffusion-fa打开 Diffusion 的 Flash Attention–vae-tilingVAE 分块处理压低出图时的显存峰值这三个参数解决的是同一件事显存装不下的部分交给 32GB 内存接住不去硬挤那张卡。你可以理解成书桌和书柜的配合常用的摊在桌上不常用的先塞回柜子要用的时候再拿桌面才始终留得下干活的地方。脚本前面还挂了一道文件检查启动前先把要用的五个文件挨个看一遍都在才继续。 Checking files... [OK] sd-server.exe [OK] Diffusion Model [OK] LLM Model [OK] LLM Vision [OK] VAE有用的是它报错的位置。模型被误删的时候它会把缺的那条完整路径打出来比等程序跑到一半自己崩掉好找得多。六、接口和局域网调用服务起来之后监听在 0.0.0.0:1234。这个写法表示监听这台机器所有的网络接口不是让你去访问 http://0.0.0.0:1234 这个地址实际访问IP是服务器地址如http://192.168.10.136:1234。图sd-server 自带的网页界面这个网页界面是 sd-server 自带的浏览器打开就能写提示词、调分辨率和种子出图在右边直接看。我调参数基本都在这里完成。要它正经干活还是走 HTTP 接口。模型跑在 3060 这台机器上Agent 跑在另一台上中间隔着局域网互调一个端口就够不用来回搬模型文件。这跟调用公司内网的接口是一个路子服务在哪台机器上不重要地址和端口通不通才要紧。别在路由器上把 1234 端口映射到公网。脚本里没有 API Key能连上这个端口的人都能直接占用你的显卡。七、实战效果下面这些图都是从这套服务里跑出来的提示词写的是中文模型对中文的理解没什么障碍。图人物写真图主题宣传画面图分镜图图城市画像图广告图图微观世界图海报图科幻场景图风景八、几点提醒1许可证要看清。Qwen-Image-2.1 用的是 Qwen Research License公开许可覆盖的是研究和评估用途商用得另外找 Qwen 拿授权接商业项目之前先把这条确认了。2这套配置只做过出图验证没做过速度基准。不同分辨率、不同步数差别很大我没有测出一组能拿来说事的时间你自己跑的时候以实际为准。3主模型目录别改名。脚本里的路径是写死的把 Qwen-Image-2.1 这类目录名改掉启动时会直接报 [ERROR] Diffusion model not found。4量化档位是显存和画质的交易。Q4_K_M 只有 4.19GB细节上是做了让步的想要更好的质感就往 Q6_K、Q8_0 上走代价是显存和速度一起往上涨。5升级程序不要覆盖旧目录。新版本单独解压成一个新文件夹两个版本并排放着新版出问题就把脚本里的程序目录切回去。有疑问的话可以在评论区留言交流。觉得有用的话欢迎点赞关注。参考资料Qwen-Image-2.1 官方发布说明Qwen-Image-2.1-GGUF 量化仓库Qwen3-VL-8B-Instruct-GGUFstable-diffusion.cpp本文为原创文章遵循 CC 4.0 BY-SA 版权协议转载请附上原文出处链接和本声明。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

原来整木定制工厂,环保和健康能兼得吗? 2026/9/27 23:49:30

原来整木定制工厂,环保和健康能兼得吗?

很多人以为“整木定制”天然就等于环保——毕竟用的是木头,能有多大问题?但真正跑过工厂、盯过工地的人会告诉你:整木定制最大的环保风险,恰恰藏在“木头之外”。胶水、油漆、安装辅料,才是甲醛和TVOC的主要来源。那有…

阅读更多 →
基于CNN的6分类垃圾分类实战:从数据准备到迁移学习 2026/9/27 23:49:30

基于CNN的6分类垃圾分类实战:从数据准备到迁移学习

简介:这份资源面向计算机、人工智能相关专业的毕业设计学生与深度学习入门者,提供一套基于Python与卷积神经网络实现六类别垃圾分类的完整项目方案。数据集涵盖glass、cardboard、metal、paper、plastic、trash六类常见生活垃圾,帮助读者在真…

阅读更多 →
SpringBoot+Vue人事管理系统实战:从零搭建前后端分离项目 2026/9/27 23:49:30

SpringBoot+Vue人事管理系统实战:从零搭建前后端分离项目

简介:这份资源是面向高校计算机相关专业毕业生与课程设计学习者的完整人事管理系统项目源码,采用SpringBoot与Vue前后端分离架构,适合作为毕业设计、课程大作业或全栈练手参考。压缩包共185个文件,约2MB,其中81个Java文…

阅读更多 →
金融信息服务系统设计与合规实践 2026/9/27 23:49:23

金融信息服务系统设计与合规实践

我无法基于当前输入生成符合要求的博文。原因如下:输入中仅提供了项目标题"financial-services",未提供任何实质性的项目正文、关键词列表或摘要描述;所谓“相关热搜词”和“最新网络热词”部分为空,未给出具体词汇&…

阅读更多 →
壁画图像修复:基于物理衰变建模的深度学习方法 2026/9/27 23:49:23

壁画图像修复:基于物理衰变建模的深度学习方法

简介:本资源聚焦壁画图像修复技术与损伤修复方法的实践研究,面向数字图像处理、文化遗产保护及计算机视觉方向的学习者与初阶研究者,提供从理论理解到代码实现的完整技术路径。压缩包共41个文件,含14个Python脚本(涵盖…

阅读更多 →
基于深度学习的水果识别系统:PyTorch源码与预训练模型实战 2026/9/27 23:49:23

基于深度学习的水果识别系统:PyTorch源码与预训练模型实战

简介:面向计算机相关专业的毕业设计者和图像识别入门学习者,这套基于深度学习的水果识别系统源码包,以卷积神经网络为核心,能够自动提取图像特征并完成多种水果的分类识别,适用于课程设计、毕业设计或快速搭建演示项目…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉