新闻详情

新闻详情

首页 / 资讯中心 / 详情

llama.cpp 三步容器化部署:免编译,直出 OpenAI 兼容推理服务

发布时间:2026/9/16 22:26:46来源:尧图网络
llama.cpp 三步容器化部署:免编译,直出 OpenAI 兼容推理服务
llama.cpp 三步容器化部署:免编译,直出 OpenAI 兼容推理服务【免费下载链接】llama.cppLLM inference in C/C项目地址: https://gitcode.com/GitHub_Trending/ll/llama.cpp只要机器装好 Docker,三条命令就能把 llama.cpp 部署成 OpenAI 兼容的推理服务:拉官方镜像、挂载 GGUF 模型、暴露 8080 端口。你付出的成本是一个模型文件,得到的回报是所有现有 OpenAI SDK 客户端改个 base_url 即可直连,编译环境全程不用碰。先看结果:两条 curl 连通补全与对话服务跑起来后,调用方式只有两种。原生流式补全,curl 加-N让 token 实时刷出来:curl -N http://localhost:8080/completion \ -H Content-Type: application/json \ -d {prompt:用一句话解释什么是容器化:,stream:true,n_predict:64}成功标准:token 以流式方式逐段输出。OpenAI 兼容入口,现有基于 OpenAI SDK 的程序只需改 base_url:curl http://localhost:8080/v1/chat/completions \ -H Content-Type: application/json \ -d {model:llama-3.1-8b-instruct,messages:[{role:user,content:你好,你是谁?}],max_tokens:128}成功标准:返回包含模型回复内容的 JSON。生产环境开了密钥后,两条请求都要补上-H Authorization: Bearer 你的key;/slots、/embeddings、/props等其余端点不多,查 tools/server/README.md 即可。按显卡挑镜像:4 个官方 tag 覆盖 CPU 与两类显卡官方镜像的 tag 按功能 × 加速后端两个维度划分,硬件对号入座:你的硬件镜像 tag宿主机额外要求纯 CPUghcr.io/ggml-org/llama.cpp:server无NVIDIAghcr.io/ggml-org/llama.cpp:server-cuda安装 nvidia-container-toolkit,运行时加--gpus allAMDghcr.io/ggml-org/llama.cpp:server-rocm装好 ROCm 驱动与运行时显卡未装专用驱动ghcr.io/ggml-org/llama.cpp:server-vulkan无驱动要求,几乎通吃各类 GPU,速度居中不确定就先用纯servertag 把链路跑通,之后只换 GPU 后缀版本,其余参数原样保留。需要经常做模型格式转换时,换成full-cuda镜像,推理和转换工具链就都有了。最小 CPU 部署:一条 docker run 起服务先别碰 GPU,用纯 CPU 镜像验证模型 → 容器 → API这条链路:mkdir -p ~/llama-docker/models docker run -d --name llama-min \ -p 8080:8080 \ -v ~/llama-docker/models:/models \ ghcr.io/ggml-org/llama.cpp:server \ -m /models/llama-3.1-8b-instruct-q4_k_m.gguf \ --host 0.0.0.0 --port 8080 -c 4096前提是把 GGUF 文件放进宿主机~/llama-docker/models/。手里没有文件时,可用full镜像临时跑一次转换,或直接从模型仓库下载现成的量化版,这一步不阻塞部署。✅先验证链路再调参:5 个参数决定速度上限验证只需一条命令:curl -s http://localhost:8080/health成功标准:返回ok,说明服务已就绪。GPU 加速的调优面,基本就盯下面这 5 个 llama-server 原生参数:参数作用起步建议--n-gpu-layers塞进显存的层数,越多越快,显存占用成正比99尽量全放;OOM 就降到 20~40-c上下文长度,决定模型能记住多长的对话4096,长文再翻倍,显存同步上涨-b提示词处理批大小512-tCPU 线程数设为物理核心数--flash-attn注意力优化开关(on/off/auto)开,长文本场景收益大默认值全部跑通之后,一次只动一个参数、对比生成速度,比背参数表更有效。Compose 一步到位:GPU、健康检查、密钥、内网下面这份编排文件一次解决五件事:GPU 卡预留、模型目录挂载、/health探测、API 密钥鉴权、禁出网的内部网络:services: llama-inference: image: ghcr.io/ggml-org/llama.cpp:server-cuda container_name: llama-inference restart: unless-stopped ports: - 8080:8080 volumes: - ./models:/models environment: - LLAMA_API_KEYchange-me-32chars - LLAMA_ARG_ENDPOINT_METRICS1 command: - -m - /models/llama-3.1-8b-instruct-q4_k_m.gguf - --host - 0.0.0.0 - --port - 8080 - -c - 4096 - --n-gpu-layers - 99 - --flash-attn - on deploy: resources: reservations: devices: - driver: nvidia count: 1 capabilities: [gpu] networks: - llama-net healthcheck: test: [CMD, curl, -f, http://localhost:8080/health] interval: 30s timeout: 10s retries: 3 networks: llama-net: driver: bridge internal: truedocker compose up -d之后,成功标准是docker ps里状态为 healthy。LLAMA_ARG_ENDPOINT_METRICS1打开了 Prometheus 格式指标,抓取配置里metrics_path指向/metrics即可拿到数据;密钥请求走Authorization: Bearer key,/health不设鉴权,直接交给编排系统探测。⚠️internal: true让容器无法访问外网,需要在线拉模型时去掉这一项,密钥防护保留。排障速查:5 类常见现象与处理现象大概率原因处理8080 连不上容器启动即退出,或宿主机端口被占先查docker logs;端口冲突就把映射改成8081:8080找不到模型文件挂载点与-m路径没对上确认-m指向/models/开头,且对应文件真在宿主机./models里进程被 OOM 杀掉-c或--n-gpu-layers撑爆内存/显存降上下文或层数,或换更低量化版本GPU 镜像却跑在 CPU 上缺 nvidia-container-toolkit,或漏了--gpus all装好 toolkit 重启 Docker,运行时带上--gpus all加了密钥后 401客户端没带鉴权头请求补Authorization: Bearer key需要更多线索时,这条比翻文档更快:docker logs --tail 100 llama-inference成功标准:日志尾部能看到模型加载进度与 8080 端口监听记录。适用边界:单机量化模型够稳,高并发不在此列这套方案适合单机私有部署 1B 到几十 B 量级的量化模型:环境全部锁在镜像里,迁移机器只要带走models/目录。但别指望它扛公开高并发——llama-server 是单进程架构,横向扩容的正路是多起几个实例、前面接一层 Nginx 或负载均衡,往单容器塞更多请求没有意义。想继续深入,docs/docker.md 有最完整的镜像清单,tools/server/README.md 列出全部 HTTP 端点与参数。【免费下载链接】llama.cppLLM inference in C/C项目地址: https://gitcode.com/GitHub_Trending/ll/llama.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

HLS与M3U8实战:视频切片、AES-128加密与多码流自适应全解析 2026/9/16 23:08:59

HLS与M3U8实战:视频切片、AES-128加密与多码流自适应全解析

做了这么多年流媒体相关的工作,HLS 是我日常打交道最多的协议之一。很多刚接触音视频开发的朋友一看到 M3U8 就以为“这不过是个列表文件”,但真正做过直播、点播、加密分发之后才会明白,这套“视频切片 索引文件 多码流自适应”的结构&…

阅读更多 →
STM32CubeProgrammer安装与CLI实战:打通AI嵌入式开发烧录闭环 2026/9/16 23:08:59

STM32CubeProgrammer安装与CLI实战:打通AI嵌入式开发烧录闭环

做嵌入式开发这么多年,装工具这事儿按理说不该单独拿出来写一集,但STM32CubeProgrammer确实值得破例。前几篇我们一直在配环境、调AI编程工具链,到这篇你会发现,真正决定开发效率的,往往不是代码编辑器多智能&#xff…

阅读更多 →
网盘直链下载助手使用指南:5 分钟本地解析八大网盘真实下载地址 2026/9/16 23:08:59

网盘直链下载助手使用指南:5 分钟本地解析八大网盘真实下载地址

网盘直链下载助手使用指南:5 分钟本地解析八大网盘真实下载地址 【免费下载链接】Online-disk-direct-link-download-assistant 一个基于 JavaScript 的网盘文件下载地址获取工具。基于【网盘直链下载助手】修改 ,支持 百度网盘 / 阿里云盘 / 中国移动云…

阅读更多 →
Home Assistant 中使用 heos.get_queue 动作读取 Denon HEOS 播放队列 2026/9/16 23:08:59

Home Assistant 中使用 heos.get_queue 动作读取 Denon HEOS 播放队列

Home Assistant 中使用 heos.get_queue 动作读取 Denon HEOS 播放队列 【免费下载链接】home-assistant.io :blue_book: Home Assistant User documentation 项目地址: https://gitcode.com/GitHub_Trending/ho/home-assistant.io 本文围绕 Home Assistant 中 Denon HEO…

阅读更多 →
TestCenter RFC2544时延测试实战:参数配置与结果解读 2026/9/16 23:08:59

TestCenter RFC2544时延测试实战:参数配置与结果解读

做网络设备验收这么多年,RFC2544的四项指标里,吞吐量、丢包率、背靠背测试做完基本都能过,唯独时延(Latency)这一项,经常被甲方现场打回来重测。不是设备真有问题,而是时延测试本身在配置、读数…

阅读更多 →
RK3588上运行17.66GB大模型的内存调度方案 2026/9/16 23:05:57

RK3588上运行17.66GB大模型的内存调度方案

1. 项目概述:当大模型撞上小内存——RK3588开发板上的“不可能任务”你有没有试过把一个17.66 GB的模型文件,硬生生塞进一块标称16 GB RAM的开发板里?不是压缩、不是裁剪、不是量化到只剩骨架,而是让它在不崩溃、不OOM、不反复swa…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞