新闻详情

新闻详情

首页 / 资讯中心 / 详情

Jev-Omni基准评测深度解读:MMAU 63%与MVBench 53%背后,12B多模态模型的真实水平有多强?

发布时间:2026/10/1 8:39:24来源:尧图网络
Jev-Omni基准评测深度解读:MMAU 63%与MVBench 53%背后,12B多模态模型的真实水平有多强?
Jev-Omni基准评测深度解读MMAU 63%与MVBench 53%背后12B多模态模型的真实水平有多强【免费下载链接】Jev-Omni项目地址: https://ai.gitcode.com/hf_mirrors/akhilaaa3/Jev-OmniJev-Omni 是一个基于 Gemma 4 12B 构建的多模态决策分类器同时支持文本、图像、音频、视频四种输入。它不走生成文字答案的老路而是直接为每个选项输出一个校准过的概率值。官方评测中它在 MMAU 上取得63.10%微平均准确率在 MVBench 视频基准上取得53.10%。这两个数字到底算什么水平这篇文章带你逐项拆解。1 分钟看懂 Jev-Omni它和聊天模型有什么本质区别 普通多模态大模型回答问题的方式是写一段话答案藏在生成的文字里Jev-Omni 换了一条路线输入一段上下文状态 一个问题 若干候选选项2 到 256 个建议不超过 20 个输出每个选项的概率例如Yes: 93.99% / No: 6.01%不生成解释文本因此输出 token 为零推理既快又便宜实现上模型在标准的多模态主干48 层、hidden_size 3840之后挂了一个决策头把最后一个隐藏状态映射到 256 个选项槽位再取 softmax。核心推理逻辑见 jev_omni.py配置细节在 decision_config.json。MMAU 63% 是什么水平横向对比一眼看懂先看官方给出的完整成绩单来自 README.md基准测试题量成绩DecisionBench Medium293 题 / 80 场景87.57%JevBench231 个决策 / 195 组86.15%MMAU1,000 题63.10%微平均MVBench2,786 题 / 14 个任务53.10%再把 Jev-Omni 放进开源大模型坐标系同表数据模型参数量MMAUMVBenchJev-Omni12B63.10%53.10%Inkling975B 总参 / 41B 激活77.20%—Qwen3.5-397B-A17B397B 总参 / 17B 激活—77.60%结论直白地说✅MMAU 63%MMAU 是公认偏难的多模态理解基准以音频理解著称12B 的 Jev-Omni 拿到 63%而参考的 975B 巨型号是 77.2%。差距约 14 个百分点说明小模型分类头路线在理解深度上还没能逼近超大 MoE 模型但考虑参数量差了两个数量级这个分数不丢人。⚠️MVBench 53%这是最需要冷静的数字。MVBench 是视频理解基准大量任务接近二选一53% 仅略高于闭着眼瞎猜距离 397B 模型的 77.6% 还有很大距离。视频是目前最弱的一环。DecisionBench / JevBench 87%在自己的主战场决策分类上表现是真正的第一梯队。一个隐藏亮点校准度 ECE 0.0400很多模型答对了但不知道自己对不对。Jev-Omni 在 DecisionBench Medium 上的 ECE期望校准误差仅0.040010 分箱越低越好——也就是说它说我有 90% 把握时大约有 90% 是真的。对工程落地来说这比裸准确率更值钱你可以直接拿概率值做置信度阈值、风险分层而不需要再训练一个校准层。上手体验一条命令跑通四模态硬件门槛不高一张能放下约 50 GB FP32 权重的 CUDA 显卡即可推理用 BF16 自动转换模型包约 24 GB。依赖清单见 requirements.txt音频输入还需 ffmpeg。pip install -r requirements.txtPython 侧核心只有两步加载模型调用predict()。完整可运行示例在 example.py最小调用长这样from jev_omni import load_jev_omni classifier load_jev_omni() result classifier.predict( stateThe meeting starts at 10 AM. It is now 9 AM., questionHas the meeting started?, options[Yes, No], )需要本地文件时 clone 仓库即可git clone https://gitcode.com/hf_mirrors/akhilaaa3/Jev-Omni性能实测H200 预热后20 次中位数输入延迟约 2k token 文本83 ms单张图片26 ms13 秒音频31 ms16 帧视频504 ms使用限制音频截断到 30 秒视频均匀采样 16 帧选项数建议 ≤ 20 个决策头上限 256 个但超过 20 个后质量未经验证。总结这份成绩单该怎么读 维度评价决策分类主战场⭐⭐⭐⭐⭐ 87%同尺寸里的强手音频/文本理解MMAU 63%⭐⭐⭐ 中规中矩小模型的合理水位视频理解MVBench 53%⭐⭐ 接近随机明显短板概率校准ECE 0.04⭐⭐⭐⭐⭐ 可直接用于生产决策成本与速度⭐⭐⭐⭐⭐ 无输出 token毫秒级响应一句话总结Jev-Omni 不是要你用它挑战所有多模态 SOTA而是给你一个又小又快、概率可信、单次调用几分钱的四模态决策引擎。如果你的场景是把结构化问题是/否、多选、打分变成自动化决策它目前的真实水平已经够用如果你的场景是复杂视频推理53% 的 MVBench 提醒你先别指望它。完 · 模型基于 Apache-2.0 协议开源可自由商用详见 README.md【免费下载链接】Jev-Omni项目地址: https://ai.gitcode.com/hf_mirrors/akhilaaa3/Jev-Omni创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

CSP-J 2023第一轮真题深度复盘与备考策略 2026/10/2 4:47:15

CSP-J 2023第一轮真题深度复盘与备考策略

简介:CSP-J 2023普及组第一轮试题及答案解析,适合初中阶段备考信息学奥赛、希望巩固基础算法的学生使用,也便于竞赛教练在课堂中按题拆解考点。资源整体为1个docx文档,压缩后仅1.6MB,打开即可阅读完整试卷、选择答案及…

阅读更多 →
游戏引擎进化史:从Doom架构分离到Unity、开源引擎与Mod生态 2026/10/2 4:47:15

游戏引擎进化史:从Doom架构分离到Unity、开源引擎与Mod生态

有时候我会想一个问题:同样是做游戏,为什么三十年前一个团队花三年才能挤出来的画面,现在的独立开发者一个人用一个周末就能搭出个能玩的Demo?答案就藏在一个词里——游戏引擎。这个被说烂了的词,其实它的诞生过程远比…

阅读更多 →
JSDBC实战:用ActiveX控件在浏览器中直连MySQL做内网调试 2026/10/2 4:47:15

JSDBC实战:用ActiveX控件在浏览器中直连MySQL做内网调试

简介:在网页开发中,有时需要绕过后台服务,让JavaScript直接读取或修改MySQL数据库中的数据,而这份资源介绍的JSDBC组件正是解决该需求的工具,它通过安装一个OCX对象,即可在浏览器脚本环境中建立与MySQL的连…

阅读更多 →
Unity AssetBundle热更新安全排查:Manifest校验与缓存一致性实战 2026/10/2 4:47:14

Unity AssetBundle热更新安全排查:Manifest校验与缓存一致性实战

1. 为什么热更新安全排查不是“锦上添花”,而是上线前的生死线Unity AssetBundle 热更新机制,表面上看只是把资源从服务器拉下来、解包、替换旧资源——一个再普通不过的IO操作。但实际项目里,我见过太多团队在版本迭代后期突然崩盘&#xff…

阅读更多 →
NetSpot实战指南:用热力图和信道分析解决Wi-Fi卡顿 2026/10/2 4:47:01

NetSpot实战指南:用热力图和信道分析解决Wi-Fi卡顿

简介:NetSpot 是一款专业的 Wi-Fi 分析与优化工具,面向家庭用户和小型企业网络管理员,可扫描周边信号、识别覆盖盲点、定位干扰源并改善无线网络质量。这份文档以 docx 形式系统整理该工具的最详细使用说明,共 1 个文件&#xff0…

阅读更多 →
VoLTE掉话分析:从信令分边到参数核对的完整排查指南 2026/10/2 4:47:01

VoLTE掉话分析:从信令分边到参数核对的完整排查指南

简介:这是一份VoLTE掉话分析的实战总结文档,面向通信工程师、网络优化人员及4G/VoLTE技术学习者。资源为单个PDF文件,压缩包大小2.58MB,内容精炼聚焦。目前已有364人学习下载。文档基于广州ATU网格实际优化项目,呈现掉…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉