新闻详情

新闻详情

首页 / 资讯中心 / 详情

[AI工程]Jev 决策模型第三篇:官方自己列了九种失败模式,它到底不能干什么

发布时间:2026/10/2 8:22:54来源:尧图网络
[AI工程]Jev 决策模型第三篇:官方自己列了九种失败模式,它到底不能干什么
前两篇把输出契约和并行评分讲完之后留在桌面上的问题其实只有一个我这个场景能不能用。评审会上被追问的则更硬跟现在的分类器比它新在哪官方有没有一句话说明它不行在哪我翻了官方文档翻到一页标题叫 “Jev 1.13 jaggedness” 的东西。里面是九条失败模式每条都配了官方自己给的替代做法页首写着 “Jev isn’t perfect”末尾写着 “Many of these will be fixed in later versions”Note 标着 “Applies tojev-1.13. Last reviewed 2026-09-17.”。这就带来一个很难受的实际问题如果我只引用官方博客里那些数字我就是在替厂商做营销如果我把官方承认的缺陷包装成其实也是优点我就是在替读者做错误决策。而这两者在技术博客里都常见。比较麻烦的是这两页的口径并不一致发布文说 “can’t hallucinate”缺陷清单页却说注入类文本能移动答案。所以真正要做的不是挑一边信而是把哪句话出自哪一页分开记。这第三篇我不想再讲它多好用而是把官方自己写下来的那些不行一条条摊开它不能干什么、边界卡在哪、同样的需求还有什么别的解法以及新范式这三个字我该不该写进你的架构评审 PPT。1. 先给结论它强在哪、弱在哪、哪几类需求根本不该找它这章回答我的需求清单里哪些可以交给它哪些从一开始就不该找它。先给一句最省事的判断它是一个只会回答选哪个 / 是不是 / 打几分的模型不会算、不会写、也不会解释为什么。官方在 jaggedness 页对jev-1.13的总述是两面一起写的它快、校准、擅长常识判断同时在需要额外几层间接推理的任务上会吃力、理解上可能相当字面、在需要数值精度的任务上表现差。下面这张表是我把官方口径jaggedness 页 models 页 confidence 页和第三方解读放在一起之后的汇总我给它的位置一列是我的判断不是官方结论。维度官方口径的强项官方口径的边界我给它的位置常识判断擅长快且校准需要额外几层间接推理会吃力能用但一题只问一个判断输出形态在你定义的答案空间里给带概率的决定不生成文本官方原话 “there are other models for that”决定交给它文本别找它数字无计数不可靠、数值接近判断不可靠、Score 不能插值一律留在代码里时间无把日期当文本读、不当有序量抽取可给它算术不给一致性语义相近输入会给定量相近输出不保证任何算术恒等式恒等式自己断言概率群体意义上校准Noul 不带 confidence单次不保证正确当门控输入别当答案抗干扰无无关内容吃准确率官方直接用 context rot 一词state 必须先过滤对抗性无默认不把 state 当敌意内容注入类文本能移动答案必须自己加第二道筛语言英语为主准确率最好含 CJK 在内能用但不等价中文负载先自评再上线定制state / instructions / criteria 塑形不 fine-tune、不 LoRA全租户同一份权重领域专有判断另想办法成本只按输入计费输出免费限额可能无通知调整成本旋钮只有 state 大小一句话把根本不该找它的需求先划掉三类任何生成文案、代码、摘要、数值与日期算术、需要模型给出理由给审计看的场景。这三类不是我推测的前两类是官方原文明确写的第三类来自官方 concepts/system-one 页——System One 模型不产推理说明。正则/代码能精确算出来的 -- Jev带概率的判断题 -- LLM要文本要解释的 -- 人不可逆动作Q1类型安全是不是就等于不会选错不等于。这一点第三方解读的口径比我诚实直接引用firecrawl 说它是只做决定的模型类型安全但仍可能选错而且不能直接生成代码truefoundry 的说法更准——它**“防的是格式错误的输出”不等于防错**beam.ai 认为它是靠只能从你给的选项里选来防幻觉适合路由、分类、工具校验生成类任务要留给 LLMflowtivity 补充了一句我觉得最该贴在评审文档首页的话它在复杂逻辑上可能**“自信地答错”**。说白了类型安全解决的是json.loads那一层的问题它让你的代码永远不会因为解析失败而挂掉判断对不对是另一件事而且官方那九条就是专门讲这件事的。Q2官方延迟和第三方实测为什么对不上先把官方原文钉准因为它比流传的说法更具体发布文写的是“End-to-end response time is 70ms-500ms”并且补了一句在 System One 形状的查询上、同等前沿智能水平下快 40x~200x。中文博客 verysmallwoods 的实测口径是端到端 350ms~1s。所以两边的差距不是模型侧 vs 端到端——官方自己也说的是端到端。真正的差在三处官方没点名对照组是哪个模型、什么部署40x~200x 这个区间被限定在 “System One shaped queries”也就是它擅长的题型第三方那侧还包含自家网络与前后处理。至于两个数量级官方原文 “two orders of magnitude faster and more efficient”它是个总述而不是某次测量我没能核实它的基准所以不写进结论文末待核实也记了一条。类型安全那条同理官方原句是“The model never makes type errors.”比转述的 “zero type errors” 更该被引用——它说的是不会越出你定义的类型不是不会判断错。另外 tradingview 转载的快讯口径比较干净TypeSafe 推出结构化决策模型 Jev不具备文本生成能力——这条至少没有歧义。2. 官方自己写了九种失败模式逐条拆开看这章回答九条失败模式分别是什么现象、什么根因、官方自己建议怎么绕。先把这页的性质说清楚它不是 FAQ是一页会过期的缺陷清单页面自身标注 Last reviewed 2026-09-17、适用于jev-1.13并写着 “Many of these will be fixed in later versions”。下面每一格的措辞我改写过事实都按官方原文。#失败模式官方条目现象为什么会这样官方建议的替代做法1Literal reading 字面理解它答的是你写出来的那个问题不是你心里想的那个范围词、否定、隐含条件全按字面读没有猜你想说什么这一层写下精确条件给每个选项写判据2Math and Numbers计数、数值接近、Score 插值都不可靠它识别的是答案的形状不是在点数算术留在代码里语义问题优于数学问题3Date and time comparison问哪个在前 / 相隔多久 / 是否落在窗口内不稳它把日期当文本读不当有序量抽取交给模型排序与时长留代码4Indirection 间接层双重否定、复杂间接表达答得没那么稳每多一跳就多一次误差机会减少跳数点名相关 state5Large state 塞无关细节准确率随无关内容增多而下降且很难判断是哪块输入带偏无关细节是干扰项先过滤只送这题需要的字段6Adversarial content注入的指令、故意误导的框架、为自身分类结果辩护的文本能移动答案官方明确写state 是数据jev-1.13默认不把它当敌意内容提示写精确上线前测边界用例7Contradictory instructions判据与指令互相矛盾时表现更差冲突信号没有优先级规则让两者对齐按普通人容易读懂的方式写8Structural invariants你以为成立的恒等式模型根本不保证一致但不做算术闭合一个决策只问一次恒等式在代码里断言9Generation靠串联 Choice 硬做生成效果不好而且会非常慢没被训练来生成文本用生成模型抽取类先列候选再让它挑2.1 字面理解错答案往往是你的锅官方那句我觉得可以裱起来原文是“When you look at a wrong answer and find yourself explaining what you really meant, that explanation is the missing half of the instruction.”我译过来当你看着一个错答案、开始解释你其实想表达什么时那段解释就是缺失的那半句指令。这条的工程含义是Jev 不给你模型替我脑补了一半的红利所以instructions和criteria要当需求文档写而不是当注释写。你写高风险订单它按字面读高风险订单你心里那个金额超 5k 且收货地址改过 且 30 天内有过退款的定义不写进去就不存在。2.2 数学与数字官方连反问都写好了计数部分官方写得很直白jev-1.13计数不可靠单词字母数、词频、长列表条目数都会错而且误差随被数对象变大而变大官方还反问了一句计数为什么要用模型能用正则或解析器找的单位就该在代码里数。官方给的改写样例就是这个思路——遍历候选、每个问一次 Noul、求和交给代码# 摘自官方 jaggedness 页的改写样例阈值与列表是官方原例非我实测fromtypesafe_sdkimportNoul,TypeSafeClient clientTypeSafeClient(modeljev-1.13)YES0.5# up to you on what you want the threshold to be, depends on your usecase.items[typesafe,apple,california,banana,likes,calibration,orange,vertex]resultclient.system_one({items:items},{fitem_{i}:Noul(instructionsfIs items[{i}] the name of a fruit?)foriinrange(len(items))},)countsum(result.nouls[fitem_{i}].noulYESforiinrange(len(items)))数值表示这条更值得注意用十六进制颜色问比用英文颜色名问表现差给它 RGB 三元组或 hex它无法可靠判断两个值是否接近问高级编程语言比问汇编/二进制指令表现好。官方的替代做法是换算在代码里做喂给它算好的数或命名好的桶模型只保留这个颜色读起来像不像警告这类真的需要判断的部分。用 Score 做数学的那条我要单独提醒不要用 score 的期望值或概率去插值还原两级之间的精确数值。可以用期望值判断有没有过某个阈值但 score 等级的数值校准很弱。也就是说0.62 分这种数字不能当连续指标做报表。2.3 日期时间官方给了一条我可以直接抄的绕法现象格式混用、相对日期、季度/结算窗口/计提期这类领域边界表现更差。官方的替代做法我认为是九条里最漂亮的一条——因为日期的每个部分都是小闭集12 个月、31 天、有界年份所以抽取这件事可以变成一个对枚举选项的 Choice还能显式加一个未说明的选项让缺失被报告而不是被猜剩下组装成真日期、排序、时长、偏移、星期全部交给代码。官方的 date extraction cookbook 给了完整写法含相对日期与置信度门控。原文 -- [Jev] Choice 抽 year / month / day枚举 未说明 -- [代码] 组装日期 -- 排序/时长/窗口判断2.4 context rot 与对抗性内容两条要连起来看无关细节这条官方是直接用词的“Jev suffers from context rot, so unrelated material in the state costs you accuracy.”并且提示 state 有界具体 token 上限去看 Models 页。对抗性内容这条是我认为整个第三篇最该被工程化对待的一条state 是数据而jev-1.13默认不把它当敌意内容为操纵模型而写的内容——注入的指令、故意误导的框架、为自身分类结果辩护的文本——能移动答案官方写我们期望未来在这点上改进。这里真正要注意的是它的分量这等于官方公开承认 prompt injection 类攻击面存在而且当前不是靠模型自身扛住的。所以只要 state 里包含用户输入、抓取内容或上游文档正文你的自动放行决策就必须有模型之外的第二道筛规则上限、金额阈值、人工队列。别把它是判别模型不是生成模型当成天然抗注入——官方没这么说过我也没看到任何依据。2.5 结构不变量官方给的两个数据很扎眼jev-1.13极其一致语义相近的输入会给定量相近的输出但很多你以为会成立的结构性恒等式模型根本不保证。官方给了两组数字我原样引用工单原文问法官方给的值“I’m not happy with the fit. What are my options here?”以 Noul 问客户是否在要求退款noul 0.22同一句工单以 yes/no Choice 问同一件事yes 0.01、no 0.99、confidence 0.97“I was charged twice for the same order. Can someone look into this?”同时问是否在要求退款与其反面refund 0.72、not_refund 0.47和为 1.19官方自己的说明是可比的只有noul与probabilities[yes]而这两处该怎么解读都不显然P(noul)与1 − P(not noul)不可直接比较的原因有很多。官方结论有两条硬性不要把在 Noul 上调好的阈值搬到 Choice 上也不要要求模型在不同问题之间满足算术恒等式。为什么 Noul 和 Choice 会不一样官方的说法是Choice 是相对的在选项之间挑哪个每条 Noul 是绝对的可能全都低。官方 skill suggestion cookbook 就在同一份候选集上同时用两者Choice 决定选哪个技能Noul 决定到底要不要推荐。这个两种问法各管一段的写法我觉得是这页缺陷清单里最值得学的一条。2.6 生成官方甚至带了句玩笑jev-1.13没被训练来生成文本靠串联 Choice 硬做生成效果不好而且会非常慢原话是 “If you really need to generate text… there are other models for that.”。抽取类任务的正确顺序反过来先用正则或生成模型列出候选再让jev-1.13从候选里挑对的那个。官方页尾还有一张 “avoid the following” 清单我原样搬成正文小表别做原因去问一个代码本来能精确算出来的东西引入不确定性还付输入 token把好几个判断藏在一个问题里概率会被糊成一团无法归因System Two 任务更多层数的间接推理官方明确列在总述短板里往 state 里塞这题用不上的上下文context rot直接掉准确率2.7 这张清单本身的意义我不想把官方愿意公开一张会过期的缺陷清单包装成产品优点——它不提升任何一次调用的准确率。但它的工程价值是实打实的它给了你一个带日期的发布前检查点。Last reviewed 2026-09-17、适用于jev-1.13、“Many of these will be fixed in later versions”这三句合起来的意思是这份清单只在这个版本上成立你上一版绕过去的坑可能已经填了你没绕的坑可能还在。所以我的做法是把这九条直接抄成回归用例的标题换版本时重跑一遍而不是把它当阅读过就算数的文档。这条是我的判断不是官方的承诺。3. 三个更隐蔽的结构性短板概率不等于置信、校准不保单次、阈值要自己养这章回答九条缺陷之外还有三条不会写进缺陷清单、但直接决定你怎么写代码的东西。3.1 confidence 只在 Choice 和 Score 上有Noul 没有官方 confidence 页的括号里写得很干脆“Noul answers don’t carry one.”。后果很具体回答形态有 confidence 吗概率语义阈值从哪来最容易踩的坑Choice有相对的在选项之间挑哪个你要自己定把 confidence 当这次一定对Noul没有绝对的可能全都低只有那个 0~1 本身把它当成置信度用Score有等级序数数值校准很弱你要自己定拿期望值插值还原精确数值说白了Noul 给你的那个数是一个概率不是置信度你若要门控就得自己定一个线而这条线官方不会给你YES 0.5那行注释写的就是 “up to you”。这跟第 2.5 节是一回事的另一面两种问法的数值语义不同阈值不能互相搬。3.2 校准是群体统计它不保证你这一次官方 AI primer 对校准的定义是跨一批预测统计成立的被打上 0.2 的结果应该约 20% 发生被打上 0.8 的应该约 80% 发生。官方同时明确写过这不保证单个答案正确concepts/system-one 页。还有一条官方说得挺坦白confidence 只是从分布形状算出的一个便捷统计量并且**“你并不被绑定在我们的定义上”**——全量probabilities都给你不同用途可能有更合适的算法官方把利弊分析推到另一篇 cookbook而那篇尚未发布。我的读法这句话把 confidence 从官方指标降级成了默认工具。如果你的门控目标是漏放行一次的代价那更合适的统计量很可能不是它而是某个选项的概率加上你自己的损失函数。flowtivity 说的复杂逻辑上可能自信地答错跟这条完全不冲突——群体校准好的模型单次当然可以坚定而错误。3.3 阈值是你的而且会随版本漂官方的建议是三句话保守起步、用自己的数据测、观察结果后再调并且同一个系统里只读操作与破坏性操作应该设不同门槛。第二条要单独盯别名会漂。jev-latest/jev-preview指向的模型会随新版本变化你这边一行代码没改答案分布可能就变了。官方建议调过阈值就 pin 版本 ID并靠响应里的model字段落日志。现实证据我核对到一个措辞克制地说官方 Models 页当前写jev-1.13.0而官方《Parallel questions》cookbook 的示例里 pin 的是jev-1.12——我核对时看到两处版本口径不一致。这里只陈述现象我不推断哪个是对的但这件事本身就是把 model 字段落到日志里的理由。你真正要同时钉死的三样模型版本 ID 每类问法的阈值 该阈值测自哪份数据 少任何一样下一次升级就是一次无人签字的行为变更4. 平台层边界只吃文本、预算固定、限额会变、数据得出域这章回答哪些不是缺陷、而是产品形态本身就决定了的硬约束。这些全部来自官方 models.md价格与限额一节含官方 Warning。我加了你要做的补偿这一列是我的判断。约束官方口径对架构的含义你要做的补偿输入模态仅文本string / JSON object / 文本数组不支持图片、音频、视频多模态需求直接出局非文本先在外部转成文本或结构化字段OCR/ASR 在你这侧上下文预算每请求 64kstate 全部问题合计、32kstate 最长单题长文档不能整篇塞切分 先过滤和 context rot 是叠在一起的两道约束速率250,000 tokens/秒、1,200 requests/分钟批量任务要按分钟算账队列、退避、以及一条明确的降级路径限额稳定性官方 Warning需求极大限额可能无通知调整更高限额走 custom/enterprise你的容量假设是软约定关键链路按可能被限流设计不当硬 SLA价格结构$0.042/Mtok$42/Btok只按输入计费输出免费state 越大越贵问题数也贵过滤 state 同时省钱和提准确率一箭双雕定制不 fine-tune、不 LoRA全租户同一份权重学不了你的领域私有词表只能靠 state / instructions / criteria 塑形否则看第 5 章语言英语为主、准确率最好含 CJK 在内的其他语言能用但不等价上非英语负载前先用自家数据测路由时格外看 confidence中文场景是二等公民评测集必须有中文真实样本英文 demo 结论不可外推训练数据不用客户请求/响应训练企业客户有 ZDR数据用途上是有承诺的但仍是托管 API——见下面一段可解释性不提供为什么这么答System One 模型不产推理说明合规解释、客服话术、审计理由都得自备在代码里记完整 state、问题、版本、概率分布关于托管 API这条我把话说清楚并且明确标注这是我的判断官方文档解决了你的数据不会被拿去训练和企业客户可以 ZDR但它没有替你解决数据出域。你的进程之外的每一次调用都是一次跨网络的数据出境字段的脱敏、境内存储、留痕合规这几件事在架构上仍然是你的不会因为它只是判别模型而自动消失。就我核对到的公开文档而言Jev 也没有提供私有化/本地形态。如果你的红线是原始文本不许出门那这条约束是硬否决项。5. 同一件事的其他解法什么时候不该选 Jev这章回答这些边界上的活儿别的方案怎么干以及你有什么 → 该用什么。先声明这一章不列对方的数字也不做精度排名——我没有跑过对照实验任何人拿一张各家准确率对比表给你看你都应该问一句在谁的数据上测的。下面只讲适配关系。你的处境更合适的解为什么判断能写成确定规则规则 / 正则官方自己就说代码能精确算的别问模型用模型只是引入不确定性和一笔输入 token有充足标注数据、类别长期稳定自己训的监督分类器含 BERT 类你可以拥有权重、延迟和离线部署代价是要维护标注与重训管道Jev 明确不做 per-tenant 微调只要语义相关性排序embedding 检索 / cross-encoder 重排有现成语料标注就能训Jev 在重排上的官方样例是每个候选一条问题靠的是判据描述而不是向量需要灵活输出形态与解释LLM 结构化输出能同时生成文本但要自己保证 schema 校验且输出照常计费我的判断数据不能出域本地小模型 / 自建分类器Jev 是托管 API就我核对到的公开文档而言没有私有化形态有标注数据吗--有-- 类别稳定吗--稳定-- 自训分类器权重归你 | --常变-- Jev判据写在 prompt 里 --没有-- 能写规则吗--能-- 规则/正则 --不能-- 只要相关性-- embedding/重排 --要文本要解释-- LLM结构化输出 --要一个带概率的决定-- Jev先在自己数据上测Q1我已经有 BERT 分类器了要不要换成 Jev我的口径是这样的类别长期稳定、标注充足、当前精度够用、延迟与合规都在你手里——不换。反过来如果你的类别每周都在改判据、标注永远凑不齐、或者你需要在一次请求里同时问十几个不同判断第 6 章会讲这件事为什么是成本结构上的质变那 Jev 值得测。这里真正的比较点不是精度而是**改一个判断这件事的成本落在谁头上**自训分类器落在数据和重训管道上Jev 落在instructions/criteria的文案上。Q2能不能用它替掉 LLM 的结构化输出取决于你要不要文本本身。firecrawl、beam.ai、flowtivity、tradingview 转载快讯在这一点上口径一致它做不了生成不能直接产出代码或文案。所以常见形态是分工——它负责选哪个 / 是不是 / 要不要执行LLM 负责把结论说给人听。如果你的 LLM 已经在做决定并且顺手生成文本那换掉它的动力只可能是延迟与成本不会是更准。Q3合规要求高的团队怎么用它把边界往前挪出域前先脱敏、只把判定所需的字段送出去这一步同时治 context rot 和成本、不可逆动作一律加人工队列。这一条不是官方建议是我给的做法。6. 是不是新范式把新和不新分别摊开这章回答新范式这三个字我该不该写进评审 PPT以及怎么诚实回答。6.1 可以称为新的部分都有官方依据主张依据我确认到什么程度输出契约变了从生成一段文本再由代码解析变成由调用方定义答案空间模型只在这个空间里给带概率的决定文档层面成立这是我认为最实质的一条一次请求里所有问题对同一份 state并行且相互独立评分官方《Parallel questions》cookbook 用 5 次重复验证批处理不改变答案多数 run-to-run std dev 0.0数字来自官方 cookbook我未复现一次问 13 题是成本结构上的质变官方 cookbook 给 12.2x 便宜、10.0x 快归因官方文档题数与口径以那篇为准。且10.0x 是官方把 13 次单题请求耗时串行加总算的并发打差距会缩小——成本那条才是无条件收益定价结构只按输入 token 计费、输出免费官方 models 页 $0.042/Mtok这在主流生成式 API 里不常见概率与阈值成为一等公民confidence / probabilities 直接支持要不要执行的门控写法成立但注意第 3 章三条短板官方直接公布带日期、承认会过期的缺陷清单jaggedness 页 Last reviewed 2026-09-17 “Many of these will be fixed in later versions”这在模型发布里确实少见6.2 不新的部分这几条我标注为我的判断分类器输出概率是几十年的老东西。XGBoost、BERT 的分类头都给概率也都要做校准。Jev 与它们的真正差别不在能不能输出概率而在要不要你自己有标注数据和训练管道。规则仍然写在提示里。判据还是instructions/criteriaprompt 当业务规则那套成本一样都没省掉不可 diff、不可单测、改一处影响面未知、会随版本漂。第 2.1 那条字面理解恰恰是这套成本的直接体现。“System One” 是借名不是理论贡献。官方自己也只说取快而聚焦的判断这层意思出处是 Kahneman 的术语包装。RLCD 我没能核实。官方 AI primer 给了它的定义和与 RLHF / RLVR 的三条路线对比但它与既有 RL 文献的关系我没有独立核实所以我不断言它是不是某篇论文方法的重命名已写进文末待核实。6.3 营销口径与第三方口径的对照官方口径第三方口径我的读法“End-to-end response time is 70ms-500ms”verysmallwoods实测端到端 350ms~1s两边都自称端到端差在对照组与自家链路别拿官方区间当你的 SLO“two orders of magnitude faster and more efficient”表格里给的是同等智能下40x~200x且限定 “System One shaped queries”未见第三方给出同口径数字限定条件它擅长的题型比倍率本身更重要引用时两句要一起引“The model never makes type errors.”truefoundry“防的是格式错误的输出”类型正确 ≠ 判断正确并行采样 RLCD 带来校准置信度flowtivity复杂逻辑上可能自信地答错校准是群体性质官方也写明不保证单次擅长常识判断verysmallwoods认为它不是推理模型适合分类路由不适合需要解释的场景与官方九条第 4、第 9 条方向一致我的诚实回答是这样交付形态上算新模型能力上是渐进改良。真正新的那一件事是决策从解析文本变成采样一个带概率的决定连带把计费结构也改了只按输入收费和输出是固定形状其实是同一件事的两面这句是我的判断。而它更聪明这种说法被官方自己那页缺陷清单当场反驳了。如果非要写进 PPT我建议只用新范式描述输出契约 定价结构这两件事别用它描述智能水平。7. 我给的采纳建议三档清单与上线前检查这章回答如果明天要开评审会我手上该有哪三张单子。第一档现在就能上低风险、高吞吐、错了可回收工单 / 评论 / 内容的分类与打标内容打分与分级离散等级不是连续数值指标候选集重排每个候选一条问题输入侧与输出侧护栏的第一道筛意图路由第二档先在自己数据上测再决定场景为什么必须先测过关判据我的中文 / CJK 内容官方口径能用但不等价并要求上非英语负载前先用自家数据测与英文基线的差距落在你业务可接受范围内直面用户与抓取内容的对抗性输入官方承认默认不把它当敌意内容注入类文本能移动答案对抗样本回归通过率 有第二道筛需要阈值调优的自动放行阈值归你且随版本要重测Noul 无 confidence只读与破坏性分别设线且有回滚位大批量长文档64k / 32k 双预算 context rot过滤后准确率不低于原文塞入且成本可算第三档现在别指望它任何生成文案、代码、摘要、数值与日期算术、需要多层间接推理的System Two任务、需要模型给出理由给审计看的场景、多模态输入。这五条前四条是官方原文直接支持的第五条来自 models 页的输入模态限制。上线前检查清单我自己归纳的条目要能当 checklist 打勾检查项对应前文怎么算过关pin 模型版本 ID并把响应的model字段落日志3.3 别名漂移日志里能唯一定位一次调用用的哪个模型按动作风险分别设阈值官方只读与破坏性不同门槛至少两条线且写进配置而非代码常量state 先过滤只留本题字段2.4 context rot 只按输入计费单次请求 token 数有明确预算并被监控每个问题只含一个判断官方 avoid 清单人工 review 一遍问题文案能挑出复合句即返工避免双重否定与反向 criteria九条里第 4 条间接层与第 7 条矛盾指令判据按普通人容易读懂的方式写Noul 与 Choice 的阈值分开调2.5 官方硬性建议两套阈值各自有数据支撑不复用同一个数准备一批对抗样本回归2.4 官方上线前测边界用例有固定的对抗集进 CI留出人工兜底通道我的判断不可逆动作有队列或二次确认记录完整 state、问题、概率分布官方不产解释复盘时能重建当时问的是什么、它给了什么分布上面那份清单里有三条是我自己的红线——这三块我现在不会让它上生产参与资金动作的数值与日期判断算术交给它等于把不可靠的东西放进不可逆路径、直面不可信输入又没有第二道筛的自动放行官方自己说注入能移动答案、要给监管或审计看的决策理由它不产解释任何理由文本都是你自己编的。{note:字段形状示例数值借用了官方文档示例不是一次真实调用记录,decision_id:ticket-20260927-0812,model:jev-1.13.0,asked_at:2026-09-27T10:12:04Z,state_keys_sent:[ticket_text,plan,region],questions:{refund_intent:{kind:noul,instructions:客户是否在要求退款,noul:0.22},route:{kind:choice,options:[refund,restate,human],probabilities:{refund:0.01,restate:0.99,human:0.0},confidence:0.97}},threshold_applied:{refund_intent:0.5,route:0.8},action_taken:restate,human_fallback_used:false}最后总结它的边界官方已经写明白了不用猜。九种失败模式字面理解、数学与数字、日期时间比较、间接层、大 state 塞无关细节、对抗性内容、指令与判据矛盾、结构不变量不成立、生成每条都配了替代做法。我的建议是把这些直接抄成你 CI 里的回归用例标题。三条结构性短板比九条缺陷更能决定代码怎么写Noul 不带 confidence、校准只是群体统计不保证单次、阈值归你且随版本重测。这三条叠在一起的含义是门控逻辑的 ownership 在你手上官方不会替你兜。平台层有四条硬线只吃文本、64k/32k 预算、限额可能无通知调整、不做 per-tenant 微调。加上一条我自己判断的它是托管 API数据出域这件事文档没替你解决。什么时候别选它有充足标注且类别稳定 → 自训分类器权重和离线部署归你纯语义排序 → embedding / cross-encoder要文本要解释 → LLM 结构化输出数据不许出门 → 本地小模型能写规则 → 规则和正则。是不是新范式交付形态新输出契约、并行独立评分、只按输入计费的定价结构、概率与阈值成一等公民、官方公开带日期的缺陷清单能力上不新分类器输出概率是老东西、规则仍写在提示里、“System One” 是借名。我不会把新范式用在它更聪明这个意思上。给后端/架构的一句话把 Jev 当一台只会做判断题、且明确告诉你它哪些题会做错的推理服务用它的价值不在于替你负责而在于让要不要执行这件事第一次变成代码里可读、可测、可门控的一个数。参考资料 致谢[1] Jev 1.13 jaggedness-官方文档[2] Models、价格与限额-官方文档[3] Confidence-官方文档[4] System One 概念-官方文档[5] AI primerRLHF / RLVR / RLCD-官方文档[6] Skill suggestion cookbookChoice 与 Noul 同场使用-官方 cookbook[7] Date extraction cookbook-官方 cookbook[8] Introducing System One models and Jev-官方博客[9] What Is Jev-Firecrawl 第三方解读
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

IDA Pro 9.3 Free版逆向入门:从PE加载到伪代码生成 2026/10/2 9:05:45

IDA Pro 9.3 Free版逆向入门:从PE加载到伪代码生成

简介:本资源是一份面向逆向工程初学者的IDA Pro系统入门教程,共十四章图文详解,聚焦二进制分析核心技能培养。内容从C语言小程序IDB分析入手,逐步覆盖基本数据类型识别与转换(D/U键操作)、操作数进制与符号…

阅读更多 →
Django request对象实战:前端传参后端接收全解析 2026/10/2 9:05:39

Django request对象实战:前端传参后端接收全解析

做Django开发有一段时间的同学,多半会碰到这样一个困惑:明明前端已经把参数传过来了,后端却拿不到,或者拿到的东西跟你预想的不一样。这个问题十有八九出在request对象的理解上。Django里的request对象,说白了就是“前…

阅读更多 →
实验检查点1全流程指南:从目标拆解到评审复盘的实操方法 2026/10/2 9:05:39

实验检查点1全流程指南:从目标拆解到评审复盘的实操方法

1. 别把检查点当成“交作业”,它是实验的“刹车片”做了这么多年实验类项目,我越来越觉得“实验检查点1”这个节点被太多人低估了。你以为它只是导师或团队要求在某个时间点提交一份进度报告?真不是。它本质上是整个实验流程里的一次“刹车校…

阅读更多 →
Python期货量化交易系统实战:从数据清洗到策略回测与模拟盘验证 2026/10/2 9:05:39

Python期货量化交易系统实战:从数据清洗到策略回测与模拟盘验证

简介:Python期货量化交易系统是一套面向金融科技学习者与高校学生的完整项目资源,融合深度学习与人工智能算法实现期货行情分析与自动化交易决策,适合作为毕业设计或课程设计选题。压缩包共120个文件,主体为71个Python脚本&#x…

阅读更多 →
Redis源码解析:Rax树——压缩前缀树的变体与实现 2026/10/2 9:05:39

Redis源码解析:Rax树——压缩前缀树的变体与实现

那次我在翻Redis Streams的源码,想知道消费者组名字到底存在哪里。顺着结构体一路找过去,看到一个叫rax的东西。第一反应是"哦,Radix Tree嘛,前缀树",但越看越不对劲——它的节点居然能在路径中间直接挂一个…

阅读更多 →
降AI率实战:4组提示词+3个改写策略让论文远离AI味 2026/10/2 9:05:32

降AI率实战:4组提示词+3个改写策略让论文远离AI味

降AI率这件事,最近已经成了论文党群里最焦虑的话题之一。写初稿用AI做辅助越来越普遍,但学校查AI率也变得越来越严格,很多同学兴冲冲拿着AI生成的初稿去查重,结果被标了一篇“红”。红意味着什么?轻则被打回重写&#…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉