新闻详情

新闻详情

首页 / 资讯中心 / 详情

Laya vs Jev:33ms 跑完决策,成本为零,开源模型正在改写 AI 路由

发布时间:2026/9/30 7:24:13来源:尧图网络
Laya vs Jev:33ms 跑完决策,成本为零,开源模型正在改写 AI 路由
Laya vs Jev33ms 跑完决策成本为零开源模型正在改写 AI 路由大多数 AI 模型是用来聊天的。你给它提示词它一个 token 一个 token 往外蹦然后你再从一堆文本里解析结果。写文章、写代码、聊天这样没问题。但如果你只是想让模型回答“这封邮件该转给哪个部门”这就太浪费了。Laya 换了个思路。它由 Convai Innovations 开发2026 年 9 月 18 日以 Apache 2.0 协议开源。Laya 不是自回归生成模型而是非自回归决策模型。你给它一段非结构化文本再加一个带类型的问题它直接返回结构化答案和校准过的概率。没有生成没有幻觉不用解析 JSON。下面说说它在实际生产里到底怎么用和 TypeSafe AI 的 Jev 比怎么样以及它适合放在什么位置。Laya 到底做什么输入工单、邮件、交易记录、提示词等。输出带类型的答案一次前向传播完成。支持三种决策原语choice从固定标签里选一个、score按序数打分比如 0 到 3、noul返回校准后的 P(true)0.0 到 1.0。输出空间是固定数字和概率所以它不会吐出坏 JSON不会编造不存在的类别也不会写一段废话让你再删。英文 checkpoint 基于 ModernBERT-large421M 参数。多语言 checkpoint 基于 mmBERT-base322M 参数覆盖 100 多种语言。它能跑在 CPU 上。Acurast 的去中心化手机网络里Laya 只用 Android CPU 和 TEE 硬件安全就能做到 0.2 到 1 秒完成决策。Laya 解决什么痛点如果你用过 8B 或 70B 的大模型来判断“这张工单该给谁”你大概已经受够了。等 500 到 2000 毫秒模型在生成你根本不需要的 token。为输出 token 付推理费然后把这些 token 全扔掉。写正则或 JSON parser只为了从自由文本里抠出一个干净标签。模型说“confidence: 0.95”但这个数字只是预测的 token 字符串不是数学上校准过的概率跟实际正确率没多大关系。Laya 的开发者 Nandakishor Mukkunnoth 说得很直接“不是每个 AI 问题都需要一个自回归聊天机器人。”Laya 和 Jev 的对比Jev 是 TypeSafe AI 做的创始人 Diogo Almeida 是前 OpenAI 研究员。Jev 把“System One 决策”变成了一个品类拿了 4000 万美元种子轮据说正在谈 100 亿美元估值的 10 亿美元融资。它是一个托管 API零样本性能很强。这两个模型真正的差别在这几个地方。速度Laya 在 Tesla T4 上 p50 每个路由问题 32.8ms。Jev 公布的中位数是 236 到 276ms。大约快 7.8 倍。在 Apple Silicon 上用 MLX独立 benchmark 测到 Laya 每个决策 7.6msJev 通过网络要 588ms。一个微调过的 browser-agent checkpoint 在 RTX 3080 上每个决策 27ms比托管版 Jev API 在同样任务上快 31 倍。校准温度缩放之后Laya 的 Expected Calibration Error 是 0.081Jev 是 0.246。这个数字越低越好当你用置信度阈值来卡自动化流程时差距很关键。准确率零样本原始准确率Jev 赢。JevBench v1.3.0 综合分Jev 74.4排第一。Laya 54.4排第 33。Banking77 上Jev 0.870Laya 0.425。但这个对比有点误导。第一Laya 的零样本底座本来就是给你微调用的。在 typed-decisions checkpoint 上微调后的 Laya 得分 0.766Jev 是 0.727。第二级联架构会完全改变经济账。一个中文客服工单分类的独立测试发现把 55% 流量交给本地 Laya7.6ms剩下升级给 Jev588ms整体准确率能追平 Jev整体速度还快 1.8 倍。成本Jev 每百万输入 token 收 0.042 美元输出免费。Laya 是 Apache 2.0。自托管每百万 token 成本 0.00 美元。没有限流没有计量没有 API key。可以完全离线跑在你自己的硬件上。对于批量任务比如给大型 RAG 候选列表分类或者处理几千张入站工单成本差距不是一点点是结构性的。数据主权Jev 是托管 API数据要离开你的网络。Laya 本地跑。页面内容、工单文本、客户消息、交易数据都不出你的基础设施。对金融、医疗、政府这些受监管行业来说这不是功能是合规底线。真实用例客服路由一条支持消息进来“我们三月份被扣了两次款请今天把重复付款退回来。” Laya 把它分类为 billing置信度 96.1%紧急度评为 2 级标记人工复核。整个调用 33ms。没有 LLM 写一段解释它为什么觉得这是账单问题。浏览器自动化一个为浏览器代理微调的 Laya checkpoint在 8 个 benchmark 里的 6 个上打败了官方浏览器微调 checkpoint。在 60 个元素的页面上稳态决策延迟在 10 到 30ms。吞吐大约每秒 100 个决策。发票和文档匹配有开发者用 Laya 解析和匹配发票没有把整个 LLM 扔上去。主题分类 5/5。客服工单意图路由 5/5。模型回答“这是退款请求吗”给出 86% 置信度结果是对的。内容审核和钓鱼检测Laya 对“这封邮件是钓鱼吗”或者“这个提示词是在尝试越狱吗”这类二值问题返回校准后的 P(true)。因为概率是校准的你可以设阈值把不确定的案例交给人工复核并且知道错误率大概是多少。边缘部署Acurast 把 Laya 部署到 175 个国家超过 28 万台 Android 手机上。模型在 CPU 上跑带硬件 TEE 安全给游戏、导航、安全检查提供实时决策完全不依赖云。目标用户与目标市场谁该用 Laya谁该用 JevLaya 适合这些情况数据不能出你的网络。金融、医疗、法律、政府团队需要离线推理。你有清晰稳定的标签也能微调。Laya 底座零样本弱微调后的 checkpoint 有竞争力。模型卡说得很明白“Laya 是一个用来做特化的快速底座。”决策类别数量中等。Laya 超过大约 20 个选项后开始退化。77 路分类Jev 还是更好。3 到 10 个路由类别Laya 绰绰有余。你处理高吞吐。每百万 token 成本 0成本曲线是平的。Jev 按 token 收费会随流量线性增长。你需要 CPU 推理。Laya 不需要 GPU。可以部署在现有基础设施、边缘设备甚至手机上。Jev 更适合这些情况你需要立刻拿到零样本准确率。没有标注数据没有微调团队没有时间训练。Jev 的零样本性能是目前最强的。你处理长上下文。Jev 支持单请求最多 64k token。测试的 Laya checkpoint 每个问题处理 512 token有些变体到 1024。你不想运维任何基础设施。Jev 是托管 API调用就能用。你的分类体系很宽。77 路银行分类、复杂多标签路由、大选项集仍然更偏向 Jev。战略图景决策模型这个品类不是赢家通吃。Jev 证明了这个市场存在。Laya 证明了它可以开源、免费而且快到能跑在手机上。更有意思的是级联模式。用本地 Laya 处理 50% 到 60% 清晰、置信度高的决策。剩下 40% 到 50% 升级给 Jev。你得到 Jev 级别的准确率大约一半的延迟成本只是零头。这不是妥协。生产系统本来就该这么架构常见情况用便宜、快、本地的推理难的情况交给云。Laya 不是要取代 Jev。它是要让你大多数决策根本不需要调用 Jev。快速开始模型权重Hugging Face (convaiinnovations/laya)代码GitHub (NandhaKishorM/laya)许可证Apache 2.0安装pip install laya如果你在评估决策模型实用建议很简单在你的真实数据上把两个都 benchmark 一遍测置信度阈值扫描试级联。架构决策不是 Laya 还是 Jev而是这条线画在哪里。总结Laya 的价值不在参数规模而在它把“决策”从“生成”里拆了出来。大多数 AI 工作流里真正需要创造力的只占一小部分剩下的都是路由、分类、打分、判断。这些事不该让一个 70B 模型一边写小作文一边做。Laya 的目标市场也不是要吃掉 Jev 的零样本高精度场景而是那些对成本、延迟、数据主权敏感的边缘和私有化场景。它的发展潜力在于生态如果社区能围绕它产出大量微调 checkpoint覆盖客服、风控、内容审核、浏览器代理这些垂直场景它会变成决策层的 Linux。不是最亮眼的但可能是最常用的。Jev 会继续守住高端零样本和长上下文市场。Laya 会从下面往上吃。最后大概率是级联共存而不是谁替代谁。如果你正在做 AI 路由、工单分类、内容审核或者浏览器代理建议花一个下午把 Laya 跑起来拿你自己的数据试 100 条。33ms 和 588ms 的差别体感比任何 benchmark 都真实。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

C++模板元编程:从看懂到敢在生产环境使用 2026/9/30 8:15:46

C++模板元编程:从看懂到敢在生产环境使用

“C模板元编程”这几个字,放在任何技术社区里都能劝退一半人,剩下的另一半里还有一大半是“看过教程但一写就废”。这玩意儿可能是整个 C 里最反直觉的一块——你写的不是程序,而是让编译器替你写程序;你调的不是运行时栈&#xf…

阅读更多 →
计算机网络实验报告模板:Wireshark抓包与TCP三次握手实战指南 2026/9/30 8:15:46

计算机网络实验报告模板:Wireshark抓包与TCP三次握手实战指南

简介:这份中北大学计算机网络实验报告面向高校计算机相关专业学生,用于完成课程实验与撰写规范报告,覆盖网络命令、抓包分析与以太网帧结构三大实验模块。包内共1个doc文档,压缩包约5.04MB,内容按实验一至实验四依次编…

阅读更多 →
手写STL list:深入理解双向循环链表、迭代器与内存管理 2026/9/30 8:15:46

手写STL list:深入理解双向循环链表、迭代器与内存管理

1. 先聊清楚:list在STL里到底是什么角色,为什么值得手动模拟凡是学过一点C的人,都会接触到vector和list这两个容器。很多人一开始根本分不清它们的区别,觉得都是"存东西的数组",直到某天面试被问到"vec…

阅读更多 →
单链表回文判断:快慢指针定位与后半段反转详解 2026/9/30 8:15:45

单链表回文判断:快慢指针定位与后半段反转详解

单链表回文判断这个问题,我在面试实战里遇到的次数不少,工作后也常拿它来给组里的新人练手。它不像红黑树、图算法那么唬人,但恰恰是这种“看起来简单、写起来全是坑”的问题,最能看出你对链表指针操作是否真的熟练。判断一个单链…

阅读更多 →
华为云数据中心方案落地指南:从57页PPT到机房改造与云平台搭建 2026/9/30 8:15:45

华为云数据中心方案落地指南:从57页PPT到机房改造与云平台搭建

简介:这份PPT面向企业IT架构师、云计算运维人员及数据中心规划者,系统梳理华为云数据中心的整体解决方案。内容从云数据发展趋势切入,剖析传统数据中心在资源利用率、能耗、业务上线周期等方面的瓶颈,进而展开华为云数据中心解决方…

阅读更多 →
Model-Optimizer:打通训练到部署的模型压缩与推理加速实战指南 2026/9/30 8:15:32

Model-Optimizer:打通训练到部署的模型压缩与推理加速实战指南

手头这个“Model-Optimizer”项目,是我基于日常推理部署需求攒的一个模型优化工具集。模型训练完只是第一步,真正棘手的是怎么把它塞进生产环境,还要跑得快、省显存、不崩精度。这个项目解决的就是训练到部署之间的那段空白:不折腾…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉