新闻详情

新闻详情

首页 / 资讯中心 / 详情

UltraData-RL-2609 Math数据集入门:3.2万道竞赛级数学题与答案匹配验证机制

发布时间:2026/9/25 14:54:42来源:尧图网络
UltraData-RL-2609 Math数据集入门:3.2万道竞赛级数学题与答案匹配验证机制
UltraData-RL-2609 Math数据集入门3.2万道竞赛级数学题与答案匹配验证机制【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609正在为数学强化学习挑选训练数据UltraData-RL-2609 Math数据集是 OpenBMB 开源的可验证奖励Verifiable Reward强化学习数据Math 切片收录32,412 道竞赛级数学题——每题都有唯一参考答案模型输出与答案做答案匹配即可自动判定对错是 RLVR可验证奖励 RL后训练的即插即用语料。 先认识 UltraData-RL-2609 是什么UltraData-RL-2609 是 UltraData 平台 L0-L4 分级数据框架中的L3 精炼数据专为 MiniCPM5-2B 等端侧模型的后训练 RL 阶段构建。整个数据集共85,995 条样本覆盖四个方向方向样本数占比结果如何验证Math32,41237.7%与ground_truth做答案匹配Code23,66527.5%沙箱执行测试用例Long-Context18,04621.0%答案匹配 上下文支撑校验Knowledge11,87213.8%答案匹配合计85,995100%其中Math 是占比最大、验证方式最纯粹的切片答案唯一、机器可判定奖励信号零人工成本。这也是本文聚焦它的原因。 Math 数据集文件结构4 个分片共 3.2 万题Math 切片存放在 data/Math/ 目录按 JSONL 分片存储每行一条题目文件样本数Math_part-1-of-4.jsonl10,000Math_part-2-of-4.jsonl10,000Math_part-3-of-4.jsonl10,000Math_part-4-of-4.jsonl2,412合计32,412题目从哪里来Math 切片由 DAPO-Math-17k、DeepScaleR 和 DeepMath-103K 三个公开可验证数学 RL 数据集取并集再统一改写为简答题形式。选择题、判断题、证明题、多问题和依赖图片的题目已在构建流水线中全部剔除——留下来的都是算出一个答案的题。题面难度分布很广从13 支铅笔 3 块橡皮 1 美元的小学生应用题到代数数域的 Galois 扩张、线性代数向量空间维数等竞赛与研究生水平题目。 样本格式统一的五字段 JSONL 结构每条样本包含 5 个字段直接看一条真实样例来自 data/Math/Math_part-1-of-4.jsonl 第一行{ uuid: Math_00001, query: Oscar buys 13 pencils and 3 erasers for $1.00. …\nPlease reason step by step, and put your final answer within \boxed{}., ground_truth: 10, source: UltraData-RL-2609, domain: Math }字段说明uuid全局唯一 ID格式为Math_序号query完整题面末尾统一追加把最终答案放入\boxed{}的指令ground_truth参考答案字符串source数据来源domain固定为Math 两个值得注意的设计\boxed{}统一答案抽取约定所有题面都要求模型把最终答案放进\boxed{}训练时只需正则抽取该表达式再与ground_truth比对即可得到 0/1 奖励无需 LLM 判分。答案形式已被标准化数值10、代数式4\sqrt{5}、分数\dfrac{2}{5}、区间[0,1]、特值Yes/No等均可自动匹配。⚙️ 核心机制答案匹配如何判定奖励Math 切片的奖励可信来自构建流水线详见 README_ZH.md 的六阶段流程中的三道关卡第 1 关 · 可验证性过滤—— 只保留答案唯一、可自动校验的题。答案不唯一或无法机器抽取的样本直接出局。第 2 关 · 多模型共识校验—— 由多个独立模型重新求解每道题按共识确认参考答案没有共识的题直接丢弃绝不猜测。同时 LLM Judge 会审核题目—答案的一致性剔除题答不符的脏数据。第 3 关 · 难度校准不碰标签—— 在 RL 初始化 checkpoint 上对每题多次 rollout估算经验通过率然后按通过率分流通过率处理策略原因 1全对❌ 移除已完全掌握无梯度信号0 p 1可学习区间✅ 保留最有学习价值 0 且标签已确认合法✅ 保留交给在线动态采样调控频率⚠️ 关键原则难度筛选只改采样权重从不修改参考答案标签——保证了奖励信号可追溯。 新手快速开始3 行代码加载 Math 数据使用 Hugging Facedatasets库config 名固定为Mathfrom datasets import load_dataset ds load_dataset(openbmb/UltraData-RL-2609, Math, splittrain) print(ds[0][query][:300]) # 查看题面 print(ds[0][ground_truth]) # 查看参考答案加载后即可按uuid定位任意样本、按\boxed{}抽取模型答案做匹配验证。若需本地克隆数据仓库地址https://gitcode.com/OpenBMB/UltraData-RL-2609。 为什么 Math 切片值得用真实提升效果数学题是 RLVR 最干净的奖励来源——对错判定不依赖主观评分训练信号稳定。实际效果上以 UltraData-RL-2609 为训练集的JustRL II实验中AIME 2025 得分在约 300 步 RL 内从 61 提升到 81 最终基于该数据完成训练的 MiniCPM5-2B 在 AIME 2025 达到86⚠️ 使用注意与许可许可项目按 Apache 2.0 发布但上游数据集的 MIT / CC BY / CC BY-SA 条款对派生内容继续适用禁止未经书面授权的原样转载或商业化再打包。静态标签构建时的难度过滤与在线采样权重不作为字段发布只保留最终入选样本。去污范围仅覆盖构建时已知的公开评测集引入新基准前建议自行去污检测。总结UltraData-RL-2609 的 Math 切片 3.2 万道答案唯一的竞赛级数学题 \boxed{}统一抽取 多模型共识背书的标签 难度校准。对想做数学 RLVR 后训练的新手来说这是一份开箱即用、奖励机制透明的完整语料。【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

智谱清言Agent实战:从零构建可落地的智能体系统 2026/9/25 15:24:18

智谱清言Agent实战:从零构建可落地的智能体系统

1. 什么是智谱清言Agent智能体?它到底能干什么 “智谱清言Agent智能体”不是某个现成App里的按钮,也不是点开就能用的网页小工具——它是一套可定义、可编排、可落地的 自主决策执行系统 。我第一次在客户现场部署它时,客户原话是&#xf…

阅读更多 →
Atlas 300V部署YOLO全指南:昇腾推理加速卡的性能调优与避坑实践 2026/9/25 15:23:46

Atlas 300V部署YOLO全指南:昇腾推理加速卡的性能调优与避坑实践

先从最直接的问题说起:Atlas 300V 24G到底是不是一张运算加速卡?是,但它不是你想的那种加速卡。很多人一看到"24G显存"就下意识拿它跟RTX 4090、A100这些GPU比,这是个挺大的误区。Atlas 300V 24G是华为昇腾系的一款推理…

阅读更多 →
fast_align 性能优化指南:OpenMP + tcmalloc,百万句对实测快 4.8 倍 2026/9/25 15:23:39

fast_align 性能优化指南:OpenMP + tcmalloc,百万句对实测快 4.8 倍

fast_align 性能优化指南:OpenMP tcmalloc,百万句对实测快 4.8 倍 【免费下载链接】AI_NovelGenerator 使用ai生成多章节的长篇小说,自动衔接上下文、伏笔 项目地址: https://gitcode.com/GitHub_Trending/ai/AI_NovelGenerator fast…

阅读更多 →
LLM+企微量化推送系统:打通策略信号到手机最后一公里 2026/9/25 15:23:39

LLM+企微量化推送系统:打通策略信号到手机最后一公里

1. 这套系统到底在解决什么问题散户做量化,最头疼的从来不是策略本身,而是“策略跑出来了,信号怎么及时送到手上”。我身边不少朋友用 Python 写完回测,收益曲线画得漂漂亮亮,结果实盘的时候还在手动刷新行情软件、手动…

阅读更多 →
Tekton Pipeline `nop` 镜像深度解析:优雅终止 Sidecar 与 Affinity Assistant 常驻容器的内部实现 2026/9/25 15:23:39

Tekton Pipeline `nop` 镜像深度解析:优雅终止 Sidecar 与 Affinity Assistant 常驻容器的内部实现

云原生CI/CDDevOps后端 【免费下载链接】pipeline A cloud-native Pipeline resource. 项目地址: https://gitcode.com/gh_mirrors/pipelin/pipeline 点击查看 免费下载 nop 是 Tekton Pipeline 内部使用的一个“最小化空操作”镜像,承担两项关键职能&a…

阅读更多 →
Atlas 300V 24G部署YOLOv5s:从ONNX到OM的完整实践与调优 2026/9/25 15:23:33

Atlas 300V 24G部署YOLOv5s:从ONNX到OM的完整实践与调优

最近帮客户做一套流水线视觉检测方案,手里的硬件正好是 Atlas 300V 24G 这张卡,任务是把 YOLOv5s 跑通,每天稳定处理几十万张图。装卡的时候同事顺嘴问了一句:“这不就是一块运算加速卡吗?跟显卡有啥区别?”…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉