新闻详情

新闻详情

首页 / 资讯中心 / 详情

Ornith-1.5-35B-A3B-GGUF如何开启推理链与工具调用:reasoning_content与OpenAI兼容接口实战指南

发布时间:2026/10/1 9:24:18来源:尧图网络
Ornith-1.5-35B-A3B-GGUF如何开启推理链与工具调用:reasoning_content与OpenAI兼容接口实战指南
Ornith-1.5-35B-A3B-GGUF如何开启推理链与工具调用reasoning_content与OpenAI兼容接口实战指南【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUFOrnith-1.5-35B-A3B-GGUF 是开源推理模型 Ornith-1.5-35B-A3B 的 GGUF 量化版本合集。这是一个约 35B 参数的混合专家MoE模型每个 token 仅激活约 3B 参数却在小尺寸模型中领先SWE-bench Verified 达 79 分MCP-Atlas 达 70.2 分。本指南教你用本地 GGUF 权重快速搭起 OpenAI 兼容接口正确开启「推理链reasoning_content」与「工具调用tool_calls」并读懂两者的返回结构。图Ornith-1.5-35B-A3B 在编码、推理与 Agent 基准上的成绩SWE-bench Verified 79、GPQA Diamond 89.2、MCP-Atlas 70.2 等为什么它天生支持推理链Ornith-1.5-35B-A3B 是一个推理模型默认情况下助手回复会先输出一段think … /think思考块再给出最终答案见 README.md 的 Quickstart 说明。关键点是思考块和正文如何分开返回取决于推理时启用哪种解析器——运行环境启用方式返回形式vLLM ≥ 0.19.1--reasoning-parser qwen3思考过程独立放入reasoning_content字段SGLang ≥ 0.5.9--reasoning-parser qwen3同上独立reasoning_content字段llama.cpp / Ollama运行时自带模板解析思考内容在响应中单独呈现正文更干净也就是说reasoning_content不是一个开关参数而是服务端解析器开启后自动产生的字段。对新手来说最省事的路线是直接用 llama.cpp 或 Ollama 跑 GGUF 文件它们开箱即用若你有 GPU 集群跑 BF16 权重再考虑 vLLM/SGLang。仓库文件一览选对量化版本本仓库直接放好了各量化档位的权重文件按需选择即可Ornith-1.5-35B-Q4_K_M.gguf体积最小显存/内存占用最省新手首选Ornith-1.5-35B-Q5_K_M.gguf质量与体积的平衡点Ornith-1.5-35B-Q6_K.gguf接近全精度适合显存充裕的机器Ornith-1.5-35B-Q8_0.gguf8 位量化质量损失极小Ornith-1.5-35B-BF16.gguf全精度版本约 70GB推荐 2×80GB GPU 起步mmproj-Ornith-1.5-35B-BF16.gguf多模态投影文件配合 BF16 主权重使用官方采样参数建议详见 README.md日常使用temperature0.6、top_p0.95、top_k20复现基准成绩则用temperature1.0。最快上手Ollama 一行命令跑 GGUF如果你的机器没有足够显存Q4_K_M 档用 Ollama 是零门槛方案ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUFOllama 会自动把 GGUF 加载进来并在本地暴露 OpenAI 兼容的/v1/chat/completions接口。之后任何 OpenAI SDK 或curl都能直接对话思考块会被自动解析、与正文分开呈现。开启工具调用llama.cpp 的 OpenAI 兼容服务想要「模型调用你的函数」推荐用 llama.cpp 的llama-server起服务这也是 Atomic.chat 等客户端的加载方式llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF --port 8000 -c 262144它支持 256K 上下文。若要在 API 层暴露tools能力在启动命令中追加自动工具选择开关即可具体参数以你使用的 llama.cpp 版本帮助文档为准。服务起来后用任何 OpenAI 兼容客户端Python、Node.js 或 curl指向http://localhost:8000/v1/chat/completions就能对话。读取 reasoning_content 与 tool_calls 的返回结构一次「开启推理 工具调用」的完整请求长这样OpenAI Python SDKfrom openai import OpenAI client OpenAI(base_urlhttp://localhost:8000/v1, api_keyEMPTY) tools [{ type: function, function: { name: get_weather, description: Get the current weather for a city, parameters: { type: object, properties: {city: {type: string}}, required: [city], }, }, }] response client.chat.completions.create( modelOrnith-1.5-35B-A3B, messages[{role: user, content: 巴黎现在天气怎么样}], toolstools, tool_choiceauto, temperature0.6, max_tokens2048, ) msg response.choices[0].message print(getattr(msg, reasoning_content, None)) # 思考过程如解析器已开启 print(msg.content) # 最终回复 print(msg.tool_calls) # 结构化函数调用如 get_weather {city: Paris}看懂三个字段就够了reasoning_content模型「想」的过程。开启推理解析器vLLM/SGLang 的--reasoning-parser qwen3后自动填充建议日志留存排查 Agent 决策问题时非常有用。content用户可见的最终答案。tool_calls标准 OpenAI 格式的函数调用。把工具执行结果以role: tool消息回填后继续对话即可组成完整的 Agent 循环。接入 Agent 与编码 CLI 的实用清单Ornith-1.5-35B-A3B 专为工具调用和 Agent 编码优化配合 OpenAI 兼容端点即可接入主流框架完整示例见 README.mdHermes Agent / OpenClaw设置OPENAI_BASE_URLhttp://localhost:8000/v1、OPENAI_API_KEYEMPTY指向你的本地服务OpenCode在配置中把本地端点注册为 provider 即可Unsloth Studiopip install unsloth后可直接加载该模型做本地推理或微调Atomic.chat直接通过 llama.cpp 的 GGUF 构建加载本仓库权重常见问题速查问题原因与解决回复里混着think标签服务端未开启推理解析器vLLM/SGLang 加--reasoning-parser qwen3或运行时版本过旧vLLM ≥ 0.19.1、SGLang ≥ 0.5.9、Transformers ≥ 5.8.1工具调用返回空确认请求里带了tools与tool_choiceauto且服务端启用了自动工具选择长任务上下文超限模型原生支持 262,144 tokens确需更长窗口时官方建议用 YaRN 扩展factor 4.0 可扩到约 1M注意静态缩放对普通长度请求可能略降质量显存不够跑 BF16换用 Ornith-1.5-35B-Q4_K_M.gguf 等量化档MoE 架构 3B 激活参数推理速度依然可观小结GGUF 权重下载下来用 Ollama 或 llama.cpp 一分钟起服务就能拿到 OpenAI 兼容接口思考过程走reasoning_content函数调用走tool_calls两条线都遵循标准 OpenAI 协议接 Agent 框架几乎零改造。建议从 Q4_K_M Ollama 起步验证流程再按硬件升级到更高精度。【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

MyBatis List批量入库优化:foreach与BATCH实战 2026/10/1 9:59:31

MyBatis List批量入库优化:foreach与BATCH实战

上周帮同事排查一个数据导入任务:从Excel解析出三万条记录,用List接住,然后逐条调用insert,跑了两分半才写完,数据库连接池还差点被打满。问题不在网络,也不在数据库配置,而是把“List入库”当成…

阅读更多 →
Win11 Edge闪白屏根因与系统级解决方案 2026/10/1 9:59:31

Win11 Edge闪白屏根因与系统级解决方案

1. 闪白屏不是Bug,是Win11与Edge协同演进中的“视觉握手失败”你刚点开Edge,屏幕猛地一白——不是黑屏卡死,也不是崩溃报错,就是那一帧刺眼、突兀、毫无征兆的纯白,像老式CRT显示器通电瞬间的强光,持续不到…

阅读更多 →
opcode CC Agents 预置智能体指南:从导入导出到源码级实现原理 2026/10/1 9:59:31

opcode CC Agents 预置智能体指南:从导入导出到源码级实现原理

桌面应用AI 应用AI Agent 【免费下载链接】opcode A powerful GUI app and Toolkit for Claude Code - Create custom agents, manage interactive Claude Code sessions, run secure background agents, and more. 项目地址: https://gitcode.com/GitHub_Trending/…

阅读更多 →
无人机静电放电ESD测试,解决低空飞行静电偶发故障 2026/10/1 9:59:31

无人机静电放电ESD测试,解决低空飞行静电偶发故障

玩无人机研发的工程师基本都遇到过这类偶发疑难故障:无人机低空飞行、空中悬停、快速起降过程中,突然出现图传闪断、导航漂移、飞控重启、姿态失控,落地后复测设备完全正常,无法复现故障,排查无果。这类无规律、偶发性…

阅读更多 →
DO-160G 爆炸大气试验:机载设备可燃环境安全验证要点 2026/10/1 9:59:25

DO-160G 爆炸大气试验:机载设备可燃环境安全验证要点

在航空与低空飞行器研发领域,多数测试聚焦设备性能、精度、使用寿命,但有一项试验只专注极端安全底线,不看功能好坏,只排查致命安全隐患,它就是DO-160G 爆炸大气试验。很多无人机、航空机载设备功能测试全部合格&#…

阅读更多 →
System Design 101:CAP 定理详解——为什么它是最容易被误解的分布式系统术语 2026/10/1 9:59:24

System Design 101:CAP 定理详解——为什么它是最容易被误解的分布式系统术语

后端文档教程 【免费下载链接】system-design-101 Explain complex systems using visuals and simple terms. Help you prepare for system design interviews. 项目地址: https://gitcode.com/GitHub_Trending/sy/system-design-101 点击查看 免费下载 CAP 定理&…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉