新闻详情

新闻详情

首页 / 资讯中心 / 详情

Jev 不生成一个字,却干掉了 Agent 90% 的上下文?

发布时间:2026/9/28 21:09:55来源:尧图网络
Jev 不生成一个字,却干掉了 Agent 90% 的上下文?
最近 Jev 这个模型在技术圈讨论度很高我研究了一下觉得挺有意思。好家伙一个不说话的模型那它到底能干啥我顺着 GitHub 上的fast-jev-compaction项目读了一遍源码又结合我们给客户做 Agent 项目时踩过的坑想了想终于搞懂了。结论先放前面Jev 不是更便宜的 GPT它更像是 Agent 系统里缺了很久的一个零件——快判断层。一、Jev 是什么一句话讲清楚Jev 是 TypeSafe AI 发布的 System One Model它刻意放弃文本生成只返回类型化的概率决策。什么意思呢打个比方。你问 GPT这段日志要不要保留GPT 会回你一段话“这段日志包含失败原因、文件路径和鉴权相关信息建议保留。”人能看懂但代码还得接着解析这段自然语言。▲ GPT 返回 vs Jev 返回对比Jev 直接返回一个数字{ answers: { result_t3: { noul: 0.87 } } }代码直接进分支if (keepResult 0.5) { keepFullResult(); }就这么简单。它不跟你解释为什么只告诉你留还是不留的概率。这是 Jev 和所有聊天模型最大的区别它把模型输出从文本变成了可执行的概率判断。有同学可能会问GPT 和 Claude 现在不也能返回 JSON 吗structured output 不香吗这确实是大家最大的疑问。但真正的差别不是能不能返回 JSON而是 Jev 从一开始就放弃自由文本生成只做封闭输出空间里的概率判断。GPT 返回 JSON 是生成式模型顺手做了个格式化Jev 是压根就不生成只打分。这个设计选择带来一个很适合 Agent 的架构分工层次职责典型组件慢思考层规划、解释、生成、复杂推理GPT / Claude / Gemini快判断层路由、筛选、评分、门禁Jev / Jev-like 模型确定性层权限、状态、副作用、回滚普通代码兜底层高风险或低置信度处理人工 / 更强模型Jev 最适合的位置不是 Agent 的大脑而是 Agent 的反射神经。大脑负责深度思考反射神经负责手碰到热锅就缩回来——不需要思考直接判断。二、为什么 Agent 需要一个快判断层这就要说到每个做 Agent 的人都踩过的坑上下文越来越长。一个修 Bug 的过程通常是——用户描述问题 → Agent 搜代码 → 读文件 → 跑测试 → 看失败日志 → 再读文件 → 改代码 → 再跑测试 → 失败就继续循环。每一步都往历史里塞内容。工具结果、错误日志、文件片段全堆进一个 context 里。真正撑爆上下文的往往不是用户说的话也不是助手说的话而是工具结果。▲ Agent 上下文膨胀过程传统做法是让大模型做 summary把旧历史压缩成一段短文本。但这有一个天然问题它能省 token但会改写事实。举个例子。测试日志长这样FAIL order-export.test.ts Error: Timeout of 5000ms exceeded at exportOrders (/repo/src/services/orderExport.ts:42:19) Expected authorization header to be preserved.如果被摘要成之前订单导出测试失败了听起来没错但关键细节全没了哪个测试失败超时阈值是多少具体定位在哪个文件第几行牵涉鉴权约束——这个问题不只是性能还涉及安全问题。上下文压缩最怕的不是删掉废话而是把关键事实改写成一句差不多。这个坑我深有体会。我们给一个客户做 Agent 客服系统的时候summary 把用户的报障信息概括掉了结果 Agent 下一步问用户已经说过的问题客户直接投诉过来体验拉胯到不行。这里面其实有三层断裂第一层生成成本和判断需求不匹配。系统只想知道这段日志要不要留这是个判断题不是作文题。但用大模型做它要读完整上下文、生成一段解释、再被代码解析链路太重了。第二层摘要会破坏可复核性。文件路径、错误码、栈信息都是精确内容摘要会把这些变成含义相近的描述。Agent 下一步不是理解大意是要继续执行动作。第三层置信度没有进入代码分支。大模型说我有 80% 把握只是文本里的自我描述不一定是校准过的概率。而 Jev 的设计目标是把概率变成接口返回值让代码可以用阈值控制行为。概率区间系统动作说明 0.8自动执行适合低风险、高重复场景0.5 ~ 0.8保守处理截断、保留摘要、请求补充信息 0.5删除或回退低价值内容可清理高风险场景转人工这里要划重点概率不是安全证明必须用自己的数据做校准和 shadow mode 验证。不能拿到 0.9 就直接上线跑。三、fast-jev-compaction不做摘要只做保留决策GitHub 上有个项目叫fast-jev-compaction我觉得它是 Jev 在工程落地中最有价值的一个用例。它的目标很窄但很真实Claude Code 的历史上下文越来越大哪些工具调用和结果可以删它的策略很克制我总结成三条用户文本不改写——里面有原始需求和硬约束助手文本不改写——里面有已承诺的计划和正在执行的思路只处理工具调用和结果——它们占空间最大也最容易过期▲ fast-jev-compaction 处理流程这和传统 summary 是两条完全不同的路线。传统 summary把旧历史改写成一段短文本。优点是省 token缺点是路径、错误码、命令参数这些精确内容可能被概括掉。fast-jev-compaction保留原文精确性重要的原样留下不重要的直接删中间态保留调用但截断结果。它把上下文压缩拆成了两个判断题keepCall这个工具调用本身还重要吗keepResult这个工具结果全文还需要保留吗两个概率组合起来就得到三种动作动作条件处理方式keepkeepResult 阈值调用和结果都完整保留drop_resultkeepResult 低但 keepCall 高保留调用截断结果drop_call两者都低调用和结果一起删除它不是总结器而是工具历史清理器。这个设计真的很聪明。它没有沿用让大模型总结历史的惯性而是把一个复合任务拆成了两个窄判断——每个判断只需要回答是或否。这其实就是 Jev 在 Agent 里的正确姿势不要让它做全局规划只让它对一批明确对象做窄判断。四、跑个 Demo 看看效果我按 fast-jev-compaction 的思路跑了一个 Demo场景是修复订单导出超时的会话里面有 4 个工具调用。结果很直观ID工具动作keepCallkeepResultt1list_dirdrop_result0.540.00t2read_filekeep0.590.69t3execute_commandkeep0.751.00t4read_filedrop_call0.470.00压缩前后对比指标压缩前压缩后变化字符数10029852减少 9177压缩率—0.915上下文减少 91.5%工具调用数43 可见删除 1 个无关调用▲ 压缩前后上下文对比91.5% 的压缩率而且关键信息一个没丢。这个 Demo 不证明 Jev 比大模型聪明但它证明了一个工程模式上下文压缩可以从总结旧历史改成判断保留价值。五、什么时候用 Jev什么时候不用做技术选型最怕的就是拿着锤子到处找钉子。我整理了一个选型对比方案优点缺点适合位置LLM JSON Schema表达能力强成本和延迟高低频复杂判断Tool Calling能和工具集成决策仍依赖生成式模型Agent 主流程动作传统分类器便宜、可本地部署标签变化不灵活稳定标签、大量数据Jev输出封闭、概率可用、高频不能生成、复杂推理弱高频局部判断可以用一个简单标准判断问题如果答案是是输出选项能提前枚举吗适合 Jev是否需要自然语言解释更适合 LLM是否高频调用适合 Jev错误是否可兜底适合 Jev是否需要多步推理不适合 Jev 单独承担▲ Jev 选型决策树还有两个容易被误读的点我觉得很重要第一“不会幻觉” ≠ “不会选错”。更准确的说法是Jev 不会输出 schema 之外的内容。你给它 keep、drop_result、drop_call 三个选项它不会编一个 maybe_keep。但它仍然可能选错。这叫类型安全不叫语义正确。第二概率可信需要自己验证。概率校准是 Jev 的核心卖点但目前公开的校准数据还不充分。正确姿势是先 shadow mode 跑一段时间 → 用自己的业务样本统计真实正确率 → 再定自动执行阈值 → 对高风险场景保守处理。六、给客户做 Agent 项目半年后的判断说实话看到 Jev 这个设计思路的时候我是有点兴奋的。因为我们给不同公司做 Agent 项目的时候遇到的最大的问题不是模型不够聪明而是太多小判断用大模型做太贵太慢。比如给一个电商客户做客服 Agent用户发一条消息进来系统要判断这是不是在问订单要不要走 RAG需不需要转人工上一次对话有没有相关上下文每一个判断如果都调一次 GPT成本直接爆炸。客户看账单的时候脸色不太好看。如果都用规则代码写泛化能力又不够换个客户就得重写一遍。Jev 这个快判断层的位置正好卡在这个缝隙里。▲ Agent 架构中的三层分工我的判断是生成负责表达判断负责分流代码负责执行。这个分工一旦成立Jev 就不只是一个新模型而是一种新的 Agent 组件设计方式。当然现在 Jev 还很早期校准数据不够充分生态也不完善。但这个方向我认为是对的——把高频、封闭、可回退的判断从生成链路里拆出来让大模型做它擅长的事让小模型做它擅长的事。这和我们给客户做 Agent 项目的思路完全一致不是什么都交给大模型而是把系统拆成该快的快、该慢的慢、该确定性的确定性。每给一个新客户做项目这套分层架构都能复用只是快判断层的 label 换一套。如果你也在做 Agent建议关注一下这个方向。不用非得上 Jev但快判断层这个架构思路值得用到自己的系统里。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

一阶IIR滤波器实战:差分方程系数计算与嵌入式C语言实现 2026/9/28 21:59:07

一阶IIR滤波器实战:差分方程系数计算与嵌入式C语言实现

1. 一阶IIR滤波器到底在做什么1.1 从一个生活场景说起你拿手机录一段语音,回放的时候发现底噪很大,嘶嘶的声音让人难受。你想把它弄干净,但又不想花太多计算资源。这时候一阶IIR滤波器就是最顺手的那把刀。它的核心逻辑特别朴素:当…

阅读更多 →
从ROS迁移到M-Robots OS:无人机编队系统实战与5大优势解析 2026/9/28 21:59:07

从ROS迁移到M-Robots OS:无人机编队系统实战与5大优势解析

1. 从一次炸机说起:为什么我要把编队系统从ROS搬到M-Robots OS去年秋天,我带着三架自组的450轴距无人机在郊外做密集编队测试。飞控跑的是PX4,机载计算机是树莓派4B,上层编队逻辑用ROS Noetic搭的。前两组动作还算稳,到…

阅读更多 →
JavaWeb小说阅读管理系统源码解析:部署、核心功能与课设避坑指南 2026/9/28 21:58:25

JavaWeb小说阅读管理系统源码解析:部署、核心功能与课设避坑指南

简介:基于JavaWeb的小说阅读管理系统设计与实现源码及课设报告(95分以上)打包在此,面向需要完成课程设计、期末大作业的计算机相关专业学生。系统实现用户注册登录、首页书籍分类浏览(历史、都市、仙侠、奇幻&#xff…

阅读更多 →
零基础用海康VM教育版做视觉定位:从环境搭建到标定实战 2026/9/28 21:58:17

零基础用海康VM教育版做视觉定位:从环境搭建到标定实战

机器视觉这行有个很现实的门槛:软件授权。很多人想入门,卡在第一步——打开官网一看,商业版授权费用不低,加密狗又是一笔开销,还没开始学就先被劝退。海康VM的教育版算是给了一条活路,功能上做了合理裁剪&a…

阅读更多 →
无人机编队协同新选择:M-Robots OS与ROS实战对比 2026/9/28 21:58:17

无人机编队协同新选择:M-Robots OS与ROS实战对比

1. 无人机编队为什么需要一套新系统1.1 从单机飞控到编队协同的跨越搞过无人机编队的人都知道,单机飞控和编队协同完全是两个维度的工程。单机场景下,飞控只管自己这一亩三分地,姿态解算、位置控制、电机输出,跑通了就完事。但一旦…

阅读更多 →
手机本地部署大模型实战:从模型量化到Android/iOS推理优化 2026/9/28 21:57:35

手机本地部署大模型实战:从模型量化到Android/iOS推理优化

1. 手机跑大模型这件事,到底靠不靠谱先说结论:能跑,但别指望它替代云端服务。我前后在骁龙8 Gen 2的Android机和iPhone 15 Pro上折腾了差不多两个月,从最初的“这玩意儿真能跑?”到后来把本地模型接进自己的笔记工作流…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉