新闻详情

新闻详情

首页 / 资讯中心 / 详情

蚂蚁牛津新作RULER:实例感知六维评分,让SVG生成告别奖励黑客

发布时间:2026/10/1 14:32:10来源:尧图网络
蚂蚁牛津新作RULER:实例感知六维评分,让SVG生成告别奖励黑客
RULER: Instance-aware Rubric Rewards for SVG Generation作者Hangyu Ran, Yuhao Zheng, Yingying Zhang, Kevin Qinghong Lin, Han Peng核心发表机构Ant Group、The Hong Kong University of Science and Technology (Guangzhou)、University of Oxford论文链接arXiv:2609.25270v1发布于arXiv 预印本cs.CV|—|—|—|—|—|—|| Pixel-based | SSIM / PSNR | Fine-grained | N/A | 否 | 否 | 否 || Rule-based | Code Length | N/A | N/A | 是 | 否 | 否 || Embedding-based | CLIPScore | Coarse-grained | Coarse-grained | 是 | 否 | 否 || Rubric-based | Universal Rubric | Fine-grained | Fine-grained | 否 | 是 | 否 || Rubric-based |Instance-aware Rubric (RULER)|Fine-grained|Fine-grained|是|是|是|RULER 的实例感知评分表同时满足无参考、多维、视觉接地、实例条件化。这是它与通用评分表奖励以及标量奖励的本质区别。在基于评分表的评估与奖励方面LLM-Rubric 提出校准的多方面评估RaR 和 RGR-GRPO 将评分表分数直接用作 RL 奖励证明细粒度检查清单反馈能改进文本域任务如指令跟随、推理的策略训练。RULER 从两个方向扩展第一通过 VLM 裁判对渲染 SVG 按实例感知评分表打分将评分表奖励应用到开放式视觉代码第二构建评分表时不使用 ground-truth SVG提供案例特定监督但不把生成限制到单一参考 SVG。与标量指标及其 RL 奖励相比论文的人机对齐研究显示 rubric 评分的相关性/排序一致性远高于 Aesthetic 与 CLIP。与专用 SVG 专家模型相比RULER 在偏好研究中对 OmniSVG 胜率66.9 % 66.9\%66.9%、对 VectorFusion53.3 % 53.3\%53.3%、对 JanusCoder96.5 % 96.5\%96.5%并在 Rubric 指标上超过这些专用方法。与迭代式扩散方法相比RULER 单次自回归生成即可且在 Rubric 上更高。与大型通用模型相比RULER-8B 匹配并在此指标上超过更大的 DeepSeek-V3 与 Qwen3-32B。与需要配对参考的目标相比RULER 的 rubric 仅由文本派生不需要配对 SVG 真值或人类偏好标签更好保留开放式生成的一对多特性。六、局限性与展望 / Limitations Future Work论文作者明确指出了若干局限。第一依赖两个外部模型一个前沿模型生成实例感知 rubric一个 VLM 评判器给渲染输出打分。奖励质量会继承它们的偏见、偏好与失效模式评判器可能高估表层线索、低估细微风格品质尤其在训练分布之外的提示上。第二RL 计算成本上升每个训练步都要渲染采样出的 SVG并查询评判 VLM 对每个渲染输出按其提示专属 rubric 打分显著贵于 CLIP 之类轻量标量奖励或基于代码的启发式信号这会限制向更大模型、更长 rollout 或更广超参搜索的扩展。第三rubric 的分解本身是一种约束把质量拆成语义、视觉、风格三轴在本文基准上有用但可能无法覆盖所有合法的艺术意图或领域特有偏好扩展到可交互、可由人操控、可领域自适应的 rubric 设计是未来工作。此外从实验设置看人类偏好研究基于 150 个 MMSVG-Bench prompts规模有限非平局胜率对不同基线差异很大从对 VectorFusion 的53.3 % 53.3\%53.3%到对 JanusCoder 的96.5 % 96.5\%96.5%说明不同基线难度不同。评分表生成与评判组件的成本、偏差或稳定性在正文片段中虽有部分讨论但更系统的成本—收益分析仍是开放问题。主表与鲁棒性表之间存在数值口径差异例如主表 RULER Rubric 为0.693 / 0.683 0.693/0.6830.693/0.683基座鲁棒性表 RULER-8B 为0.692 / 0.662 0.692/0.6620.692/0.662这提醒读者引用具体数值时必须注明来源表与实验设置。未来工作可能包括降低评判成本例如蒸馏轻量评判器或缓存评分设计可交互、可操控的 rubric把实例感知 rubric 奖励扩展到其他开放式视觉代码生成任务以及在更广泛的分布外提示上系统检验评判器偏差。七、总结 / ConclusionRULER 针对开放式 SVG 生成中“没有绝对视觉真值”导致评估与策略优化都缺乏忠实信号的问题提出了一条基于 rubric 的解决路径。论文首先通过人机对齐研究确立多轴 rubric 评分与人类判断的相关性和成对排序一致性远好于 Aesthetic 与 CLIP 等标量指标。在此基础上RULER 把每条指令转换为实例感知的六项评分表覆盖语义保真、视觉质量与渲染风格三个轴裁判 VLM 对渲染 rollout 逐项打分加权满意度构成密集奖励并用 GRPO 优化。因为评分表仅从文本指令推导RULER 不需要配对 SVG ground truth也不需要人类偏好标签。在 MMSVG-Illustration 与 MMSVG-Icon 上RULER 将 Rubric score 从0.432 / 0.395 0.432/0.3950.432/0.395提升到0.693 / 0.683 0.693/0.6830.693/0.683超过专用 SVG 专家模型匹配规模大得多的 DeepSeek-V3并在盲测人类偏好研究中取得对五个基线均超过50 % 50\%50%的非平局胜率。消融实验进一步指出奖励设计是开放式 SVG 生成 RL 的主动杠杆标量多指标奖励会触发 reward hacking通用评分表奖励能稳定提升但缺乏实例级粒度只有实例感知评分表同时改善多个维度。尽管仍存在对外部模型与评判成本的依赖RULER 表明把模糊的视觉判断转化为实例条件化的显式子目标是提升开放式视觉代码生成质量的有效方向。原文摘要:Generating Scalable Vector Graphics (SVG) code from natural-language instructions is an open-ended task without absolute visual ground truth, leaving both evaluation and policy optimization without a faithful signal. Scalar metrics (CLIP, Aesthetic) calibrated on natural images transfer poorly to stylized vector content, and reusing them as RL rewards triggers reward hacking. We address both limitations with rubric-based scoring. We first establish empirically that prompting a vision-language judge with a multi-axis rubric correlates with human judgments far better than scalar metrics, both across samples and within instructions. Building on this finding, we introduce RULER (Instance-aware Rubric Rewards for Reinforcement Learning), which converts each instruction into an instance-aware rubric of six items spanning semantic, visual, and stylistic axes; a judge VLM scores rendered rollouts item-by-item, and the weighted satisfactions form a fine-grained reward optimized via Group Relative Policy Optimization. Because the rubric is derived from text alone, RULER requires neither paired SVG ground truth nor human preference labels. On MMSVG-Illustration and MMSVG-Icon, RULER lifts the rubric score from 0.432/0.395 to 0.693/0.683, surpassing dedicated SVG specialists and matching the substantially larger DeepSeek-V3, with ablations identifying rubric design as the active lever for RL on open-ended SVG generation. The project page is available at https://hangyuran.github.io/RULER/.PDF链接:https://arxiv.org/pdf/2609.25270v1部分平台可能图片显示异常请以我的博客内容为准
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

基于微信小程序与Spring Boot的马拉松报名系统设计与实现 2026/10/1 16:10:57

基于微信小程序与Spring Boot的马拉松报名系统设计与实现

马拉松报名这个选题,我隔壁学弟毕业设计做的就是它,去年帮他改代码改到凌晨两点,完工那一刻整个人是崩溃的,但回头一看,这套东西从技术深度到展示效果确实能打。微信小程序端报名、后台赛事管理、在线支付、参赛凭证生…

阅读更多 →
官网GEO优化行业现状与选择指南:正规服务商能力调研报告 2026/10/1 16:10:57

官网GEO优化行业现状与选择指南:正规服务商能力调研报告

官网GEO优化行业现状与选择指南:正规服务商能力调研报告 行业大众选择时的4大踩坑难题很多企业在布局官网GEO优化时,很容易踩进几个典型的认知和实践误区,几乎是从业者都会遇到的共性问题。 找不到能真正匹配AI搜索逻辑的服务商:市…

阅读更多 →
第一个小项目,流水灯,嵌入式52单片机 2026/10/1 16:10:57

第一个小项目,流水灯,嵌入式52单片机

阅读更多 →
苏州地区医美GEO优化公司有哪些?口碑好的服务商推荐 2026/10/1 16:10:56

苏州地区医美GEO优化公司有哪些?口碑好的服务商推荐

当求美者想了解双眼皮、、皮肤管理等医美项目时,第一站已经不再是传统搜索引擎,而是直接向豆包、DeepSeek、文心一言、Kimi等AI助手提问:苏州口碑好的医美机构有哪些做鼻综合哪家医生技术好整形医院怎么选。医美行业的信息差大、决策周期长&a…

阅读更多 →
PackML状态机与标签体系:包装产线互操作与OEE标准化实践 2026/10/1 16:10:50

PackML状态机与标签体系:包装产线互操作与OEE标准化实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
上新日 | 双手不用离开键盘,也能丝滑操控 Mac!Cursor Crane 上架 2026/10/1 16:10:44

上新日 | 双手不用离开键盘,也能丝滑操控 Mac!Cursor Crane 上架

买正版软件? 学软件技巧? 欢迎访「数码荔枝」这周的上新日挪到周四啦!明天就是中秋节假期了~祝大家节日快乐!平时我们在写东西、改代码或者处理表格时,明明双手都在键盘上,却经常因为要点一下「运行」「导出」「发送…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉