新闻详情

新闻详情

首页 / 资讯中心 / 详情

Switchyard阶段路由原理:WRONG与PROGRESS双轴信号如何决定模型档位

发布时间:2026/8/31 9:23:45来源:尧图网络
Switchyard阶段路由原理:WRONG与PROGRESS双轴信号如何决定模型档位
Switchyard阶段路由原理WRONG与PROGRESS双轴信号如何决定模型档位【免费下载链接】SwitchyardSwitchyard lets LLM applications route traffic across models and providers while preserving native OpenAI and Anthropic API compatibility - enabling flexible model selection, benchmarking, and cost/performance optimization.项目地址: https://gitcode.com/GitHub_Trending/switch/SwitchyardSwitchyard 是一款开源 LLM 流量路由工具让应用在保留 OpenAI 与 Anthropic 原生 API 兼容性的前提下把请求智能分发到不同模型与供应商之间。它的 Stage-Router阶段路由算法是其中最有趣的设计通过观察对话里的工具结果历史用WRONG与PROGRESS两条轴的信号实时判断这一轮该交给强档还是省档模型从而在成本与质量之间自动找到平衡点。 阶段路由是什么capable 与 efficient 双档位阶段路由type stage_router的核心思路是编码 Agent 的一次运行会经历不同阶段——前期探索代码库、从错误中恢复后期进入机械化的实现工作。不同阶段对模型能力的要求不同路由器就据此切换档位capable强档能力强的模型负责探索、排错、复杂推理efficient省档便宜高效的模型承担常规机械任务。两个旋钮决定行为配置项作用picker信号不明确时的默认档位。efficient_first省档优先成本优先capable_first强档优先质量优先实验性confidence_threshold信号置信度门槛只有越线才按信号切换档位推荐起点0.5完整原理与配置见官方文档stage_router_routing.md算法主体在 crates/libsy/src/algorithms/stage.rs。⚠️ WRONG 轴错误严重度、空转与探索三类信号WRONG 轴度量这一轮出了多少问题信号全部来自最近几轮默认窗口 3 轮的工具结果把三类情况推向capable信号含义典型来源severity窗口内错误的最大严重度分三档soft0.3如非零退出码、hard0.7如 Traceback、ImportError、超时、critical1.0如 OOM、连接被拒内置错误模式表做文本匹配spinning深度轮次≥8 轮中没有任何读、规划、写操作纯空转工具调用统计exploring深度轮次中只有读和规划、没有产出代码工具调用统计spinning和exploring互斥保证同一次无产出不会被重复计分。错误模式表OOM、traceback、command not found等在 tool_signals.rs 中维护窗口大小由recent_turn_window配置默认值见 DEFAULT_RECENT_WINDOW。 PROGRESS 轴生产强度与已收口信号PROGRESS 轴度量这一轮正在稳定产出吗把轮次推向efficientproduction_intensity生产强度最近窗口内写操作Write/Edit包括sed -i、重定向等 Bash 变体占全部工具操作的比例取值 0~1tests_passed如果最近测试通过、且有写操作、窗口内无错误——说明任务已收口直接降级到省档。直觉很好理解模型正在稳定地写代码、测试还绿着就该换便宜的模型继续跑。 双轴评分公式tanh 如何把信号压成置信度评分器score_signal把四个维度加权求和后用 tanh 压缩每个信号满格计 0.10 个信号单位原始分 0.10 × (severity/0.7 spinning exploring − production_intensity)最终分数 tanh(5.0 × 原始分)取值 (−1, 1)正 → capable负 → efficient置信度 |分数|即信号指向某一档位的把握。这个设计刻意做成**相互佐证corroborative**的信号状态置信度能否越过 0.5 门槛单个满格 WRONG 信号如一次 hard 错误≈0.46❌ 差一点两个信号佐证如 hard 错误 空转≈0.76✅ 果断升级也就是说单靠一个中等信号不足以换档必须两条证据对得上才行动——这大大降低了误升级带来的成本波动。 模型档位决策瀑布从硬升级到默认档拿到信号后决策按固定顺序执行pick_tier先触发者胜出硬升级overridecritical 级错误severity1.0或上下文刚被压缩——无视评分直接强档硬降级tests_passed测试通过 有产出 无错误——直接省档评分裁决dimensions置信度 ≥ 门槛按分数正负选档位兜底fall open置信度不足——交给可选的 LLM 裁判分类器没有裁判就落在 picker 的默认档。注意第 1 步优先于第 2 步哪怕测试恰好通过了critical 错误仍然赢。每个请求最终都会打上decision_source标签override / tests_passed / dimensions / llm-classifier / fall_open用于统计与排查。️ confidence_threshold 推荐值与调优方法confidence_threshold是整套机制唯一的显式旋钮官方推荐显式设为 0.5来自 SWE-Bench Pro Python-75 校准。常用配置阈值是否配裁判适用场景0.0否极致省钱任何信号裁决都接受零额外 LLM 调用0.5否推荐起点需约 1.5 个信号佐证才换档0.7–0.9是低置信轮次交给 LLM 裁判兜底1.0必须纯裁判驱动信号只保留硬升级/降级一个最小可运行的路由配置[targets.strong] id openai/gpt-4o llm_client openrouter [targets.weak] id openai/gpt-4o-mini llm_client openrouter [routes.stage] id switchyard/stage type stage_router capable_target strong efficient_target weak picker efficient_first confidence_threshold 0.5 recent_turn_window 3进阶技巧配置[routes.stage.handoff_notes]后信号驱动的升级会随请求附上一句交接便签默认仅在 WRONG 信号触发升级时发送提示强档模型上一位卡住了继续诊断完整 schema 见 toml_schema.md。 可观测性如何查看每个请求的档位决策响应头x-model-router-selected-model直接告诉你这一轮被路由到了哪个模型/v1/stats接口按decision_source× 目标模型统计路由决策并输出 severity、spinning、exploring、production_intensity 四个维度的分布直方图实现见 stage_router.rs结构化决策日志解释单条选择的完整推理路径。 什么时候不适合用阶段路由单模型部署 → 用passthrough固定比例的 A/B 分流 → 用 random 路由纯聊天、几乎没有工具调用结果 → 信号无米下锅所有模糊请求都会落到默认档。想深入了解整体架构可以从 core_concepts.md 和 architecture.md 入手本文涉及的评分与信号源码集中在 crates/libsy/src/algorithms/util/ 目录下值得对照阅读。【免费下载链接】SwitchyardSwitchyard lets LLM applications route traffic across models and providers while preserving native OpenAI and Anthropic API compatibility - enabling flexible model selection, benchmarking, and cost/performance optimization.项目地址: https://gitcode.com/GitHub_Trending/switch/Switchyard创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

ToolJet 完整指南:开源低代码平台,几天搭出内部工具与 AI 应用 2026/8/31 10:13:54

ToolJet 完整指南:开源低代码平台,几天搭出内部工具与 AI 应用

ToolJet 完整指南:开源低代码平台,几天搭出内部工具与 AI 应用 【免费下载链接】ToolJet ToolJet is the open-source foundation of ToolJet AI - the enterprise app generation platform for building internal tools, dashboard, business applicati…

阅读更多 →
Cloudflare Computer 实战教程:容器里跑 pandoc 把 Markdown 变成 PDF,5 步搞定 2026/8/31 10:13:54

Cloudflare Computer 实战教程:容器里跑 pandoc 把 Markdown 变成 PDF,5 步搞定

Cloudflare Computer 实战教程:容器里跑 pandoc 把 Markdown 变成 PDF,5 步搞定 【免费下载链接】computer Give your agent a computer 👾 项目地址: https://gitcode.com/GitHub_Trending/computer1/computer 概要:Cloudf…

阅读更多 →
技术博客的选题标准:为什么非技术内容无法成为CSDN文章 2026/8/31 10:13:54

技术博客的选题标准:为什么非技术内容无法成为CSDN文章

抱歉,我无法基于这个标题生成 CSDN 技术博客。 原因很简单:这段文字是一则线下活动通知,内容涉及老师与学生约定在餐厅见面,并非计算机技术、开发工具、框架或项目实战相关主题。它既没有技术概念,也没有可操作的代码…

阅读更多 →
不买服务器!用内网穿透把本地项目一键生成临时公网预览链接 2026/8/31 10:13:54

不买服务器!用内网穿透把本地项目一键生成临时公网预览链接

最近接到不少朋友问同一个问题:项目在本地跑得好好的,客户却一直催着要看效果,难道每次都要先买服务器、配环境、上传代码、再等域名解析?如果只是为了给客户预览一个页面、演示一个交互流程,这种传统部署路径实在太重…

阅读更多 →
CIMPro发布态AI助手:从脚本调试到工程维护的智能实战指南 2026/8/31 10:13:53

CIMPro发布态AI助手:从脚本调试到工程维护的智能实战指南

之前做组态工程、二次开发时,最费时间的往往不是功能逻辑本身,而是在发布态环境下反复调试脚本、排查表达式、核对数据关联关系。尤其是团队里新手接手时,光是把“开发态能做、发布态为什么不行”这类问题讲清楚,就要花掉不少沟通…

阅读更多 →
27考研408计算机网络强化:从分层模型到真题实战 2026/8/31 10:08:53

27考研408计算机网络强化:从分层模型到真题实战

计算机网络在 408 统考中通常占 25 分左右,题型以选择题和一道综合题为主。分数看起来不算最高,但它是四门课里“上手容易、考好难”的典型:协议多、层次多、概念容易混淆,很多考生学完第一轮之后,做题仍然会错掉一半以…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞