新闻详情

新闻详情

首页 / 资讯中心 / 详情

CLM vs Jev:开源决策层正在改写 Agent 的底层逻辑

发布时间:2026/9/28 19:56:23来源:尧图网络
CLM vs Jev:开源决策层正在改写 Agent 的底层逻辑
CLM vs Jev开源决策层正在改写 Agent 的底层逻辑如果你正在做 Agent大概率见过这种浪费一个分类、路由、权限判断也要调大模型生成一堆 token然后应用层立刻把它们丢掉。慢、贵还容易格式跑偏。Jev 和 CLM 都在解决这个问题但路线完全不同。一个更像托管决策 API一个更像你能自己掌控的决策层。下面把架构、性能、成本和适用场景拆开讲。CLM 到底是什么CLM 全称 Contrastive Language Models对比语言模型。团队把它称为 System One 模型借鉴的是认知科学里快速、直觉式决策的概念。目前发布的是 CLM-8B设计非常克制用冻结的 Qwen3-8B 作为共享编码器。上面挂两个轻量投影头每个大约 2000 万参数。一个编码状态一个编码动作。训练用双向 InfoNCE 损失把匹配的状态动作对拉近把不匹配的推远。训练分三段6000 万 Nemotron 问答对3000 万合成难负样本100 万智能体轨迹。推理时更直接。模型先编码当前状态再拿这个嵌入去和候选动作嵌入比相似度选最近的那个。没有 token 生成没有自回归解码就是一次相似度计算。缓存才是 CLM 的经济学杀手锏状态编码器和动作编码器分开带来一个 Jev 那种单体架构不容易复制的优势动作嵌入缓存。企业 Agent 的动作集通常很稳定。IT 支持 Agent 可能就 50 个动作重置密码、开通权限、建工单、升级到安全团队。客服 Agent 可能就 30 个路由选项。这些动作不会每分钟变一次。CLM 可以先把这些动作编码一次缓存起来后面每个请求只编码变化的状态再和缓存动作算相似度。实际延迟差距很明显。单张 RTX 4090重复状态加 3 个或 50 个动作时p50 从大约 1.7 到 2.0 毫秒降到 0.6 到 0.7 毫秒。如果每个状态都是全新的优势会缩小但动作缓存仍然省掉大量重复计算。这不是小优化是架构级的复利。Jev 仍然强的地方Jev 没停步某些场景依然有优势。Jev 用 RLCD 训练显式优化概率校准。它说 70% 紧急那大致 70% 的相似预测应该是对的。风险评分、审核分流、需要人工介入阈值的工作流很吃这一点。工具调用准确率Jev 仍领先。BFCL v4 上Jev 99.2%CLM 95.2%。WikiRacing 上Jev 完成 30/30CLM 完成 26/30。差距不算巨大但生产系统里错一次工具调用有后果时几个百分点很重要。价格很激进。每百万输入 token 0.042 美元输出免费在合适分类任务上大约是前沿 LLM 的 1/445。TypeSafe 把 Jev 定位成即插即用决策层。LangChain 的 AutoModeMiddleware 集成让已经在那个生态里的团队很容易上手。速度对比要放回场景里看“比 Jev 快 9 倍”这个标题数字得拆开看。T-Rex 游戏测试里CLM-8B 决策 16.5 毫秒Jev 149.8 毫秒。候选动作大约 1000 个时CLM 快 13 倍。这些是受控测试里的真实数字但对应的是动作缓存收益最大的负载。9 倍不是通用倍数。它是动作集大且稳定、大量请求共享缓存时的最佳情况。动作空间动态变化或者每次状态都新速度优势会收窄。VentureBeat 的报道也说得比较准零样本测试里 CLM-8B 快至 9 倍两项游戏任务成功率和 Jev 打平但工具调用准确率让步WikiRacing 完成任务更少。编码验证器这个用例被低估了CLM 最有价值的演示之一不在主决策循环而在二级验证。流程是这样强生成模型比如 Opus 5 先产出多个候选代码方案微调后的 CLM-8B 来评估并挑最好的。CLM 不写代码它只给已有方案排序。结果很能说明问题DeepSWE 上Opus 5 单次尝试成功率从 73.7% 提到 81.6%。Terminal-Bench 2.1 上从 84.0% 提到 87.6%。CLM-8B 在这两个基准上作为验证器达到新的 SOTA同一角色比 Jev 快 4 到 6 倍。这个模式用强 LLM 生成候选用快速对比模型做选择天然适合 CLM。动作集就是候选方案状态就是任务描述决策就是排序。目标用户和市场位置CLM 和 Jev 的用户有重叠但定位不同。CLM 是 Apache 2.0 开源可以自托管。冻结骨干加轻量投影头微调便宜只训 2000 万参数的投影头不用动 80 亿的全模型。单张 GPU 就能适配专有领域数据不用出内网。这对受监管行业很重要。金融公司不能把客户交互数据发到第三方 API 做每次路由。医疗机构也不能随便把患者查询送到外部分类服务。CLM 给这类团队一条自托管 System One 的路径。Jev 的目标市场不一样。它 API 优先LangChain 集成顺滑适合不想管基础设施、只想用决策智能的团队。每百万 token 0.042 美元在高吞吐分类场景下当自托管 GPU 成本高于 API 账单时吸引力很强。System One 这个品类还在形成。Jev 的发布证明需求是真的。Vercel 报告说Jev 接入 AI Gateway 后 24 小时内接近 13% 的付费团队采用是 GPT-5.6 首日采用率的两倍也是 Claude Fable 5.1 的六倍多。这不是小众好奇是团队真的想要不用全生成模型调用的决策层。两者共同解决的痛点Agent 循环把大量算力浪费在不需要文本生成的决策上。一个支持工单是不是紧急该哪个部门处理某个工具调用有没有风险这些事调用前沿 LLM 属于架构过度。模型生成 token应用立刻丢弃。慢、贵还容易偏离输出 schema。System One 模型就是来消除这种浪费的。CLM 和 Jev 都返回带概率的类型化结构化输出都在毫秒级完成成本都比生成方案低几个数量级。区别在解法。Jev 用专用架构RLCD 端到端训练。CLM 用冻结骨干加对比投影头。都能用没有谁在所有场景都绝对更优。总结CLM-8B 是对比 LM 团队的第一版不是终局。有消息说 2026 年 10 月会来一个更大的 CLM-35B 多模态版本。如果 8B 已经在几个基准上追平 Jev而且在缓存友好场景明显更快35B 有可能缩小准确率差距同时保留架构优势。更深层的趋势是 Agent 系统开始分层。不是一个模型包办所有事而是生成模型做推理和内容System One 模型做快速决策确定性代码做执行和授权。Jev 和 CLM 在抢中间层这种竞争会让速度和成本继续快速改进。今天做 Agent实际要问的不是抽象意义上谁更好而是你的决策负载更适合缓存动作嵌入还是校准概率输出你需要自托管还是 API 简单更重要你的动作集是否稳定到能吃下 CLM 的缓存红利不同团队答案不同。好消息是现在两个选项都在一个闭源一个开源。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

2026 论文重复率 AI 率双高?一站式降AIGC平台实测解析 2026/9/28 20:54:41

2026 论文重复率 AI 率双高?一站式降AIGC平台实测解析

一、前言:2026 高校论文审核新难题 随着高校学术审核体系不断升级,知网、维普等主流检测平台全面上线AIGC 智能检测功能,当代毕业生的论文写作与修改迎来双重考验。以往论文仅需攻克重复率超标问题,如今还要规避 AI 写作痕迹检测风…

阅读更多 →
Yao OAuth ACL 权限执行引擎深度解析:五层校验链与数据访问约束实战指南 2026/9/28 20:54:41

Yao OAuth ACL 权限执行引擎深度解析:五层校验链与数据访问约束实战指南

Agent 框架后端低代码RAG 【免费下载链接】yao ✨ All your agents and workspaces in one place, on every device you own. Track tasks on a board, accessible from desktop, mobile, browser, or API. Self-hosted. 项目地址: https://gitcode.com/gh_mirrors/…

阅读更多 →
React Native for OpenHarmony 三方库 expo-screen-orientation 57.0.2 适配实战:四向锁定、策略映射与事件清理 2026/9/28 20:54:41

React Native for OpenHarmony 三方库 expo-screen-orientation 57.0.2 适配实战:四向锁定、策略映射与事件清理

React Native for OpenHarmony 三方库 expo-screen-orientation 57.0.2 适配实战:四向锁定、策略映射与事件清理 屏幕方向适配最容易被“手机转了”这件事骗过。窗口策略、系统实际方向和事件回调使用的是三套枚举。本篇面向新手,从这些概念开始&#xf…

阅读更多 →
200行代码写一个agent 2026/9/28 20:54:41

200行代码写一个agent

开头的一个问题 “如果不能用 70 行代码写出一个 agent,就不算真的懂 agent 原理。” 这句话是我一直放在桌面上的一句提醒。现在各种 agent 框架满天飞——LangChain、CrewAI、AutoGen、Mastra……工具越来越多,但有一个问题始终没有被回答清楚&#xf…

阅读更多 →
OpenCV3人脸检测与特效实战:Haar、MediaPipe、头顶LOGO、换底色全攻略 2026/9/28 20:54:34

OpenCV3人脸检测与特效实战:Haar、MediaPipe、头顶LOGO、换底色全攻略

简介:基于 OpenCV3 图像处理库整理的项目合集,覆盖人脸检测、人脸特效、头顶加 LOGO 等常见图像操作,适合刚接触视觉开发或希望积累实战例子的开发者参考。资源共 50 个文件,压缩包大小 34.36 MB;核心为 8 个 Python 脚…

阅读更多 →
电机FOC位置闭环抖动原因排查:8个关键点与调试速查清单 2026/9/28 20:54:34

电机FOC位置闭环抖动原因排查:8个关键点与调试速查清单

做FOC位置闭环调试的工程师,大概率都经历过一个让人头大的场景:电机带负载能转、速度环跑得也很顺,但一旦切成位置模式,电机就停在原地“嗡嗡”地抖,轴来回摆动几度,电流波形像被扰乱的正弦波。这种原地抖动…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉