新闻详情

新闻详情

首页 / 资讯中心 / 详情

UltraData-RL-2609数据构建流水线揭秘:从原始数据到RL-ready样本的6个阶段

发布时间:2026/9/26 11:52:27来源:尧图网络
UltraData-RL-2609数据构建流水线揭秘:从原始数据到RL-ready样本的6个阶段
UltraData-RL-2609数据构建流水线揭秘从原始数据到RL-ready样本的6个阶段【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609UltraData-RL-2609 是 OpenBMBMiniCPM 团队面向大模型强化学习RL后训练发布的 RL 数据集共 85,995 条可验证任务样本覆盖数学、代码、长上下文与科学推理四大领域。它的核心价值在于一条六阶段数据构建流水线从原始数据整合、标准化改写到可验证性过滤、奖励可信性校验、难度校准最终整理为统一的 RL-ready 样本。本文将完整拆解这条流水线的每个阶段帮助你理解高质量 RL 训练数据是如何炼成的。 数据全景4 大领域85,995 条样本领域样本数占比任务类型结果如何验证Math32,41237.7%竞赛 / 教材类数学题答案唯一可抽取与参考答案做答案匹配Code23,66527.5%按自然语言描述生成程序用测试用例执行提交代码Long-Context18,04621.0%长文档多跳问答答案匹配且上下文保证支撑答案Knowledge11,87213.8%科学 / 知识推理简答题与参考答案做答案匹配数据围绕三个目标构建结果可判定verifiable、奖励可信trustworthy、难度适配calibrated让策略模型获得稳定、可追溯的训练信号。各领域的原始数据文件可按目录浏览data/Math/、data/Code/、data/Long_Context/、data/Knowledge/。️ 六阶段构建流水线全拆解四个领域共用同一套六阶段流程只是在各环节使用领域专属的验证器与筛选规则。阶段 1 · 数据准备与来源整合按领域汇聚上游公开数据集与合成数据MathDAPO、DeepScaleR、DeepMath 三个公开可验证数学 RL 数据集取并集Knowledge / STEMOpenScienceReasoning-2 科学推理数据Long-ContextHotpotQA、Qasper、MuSiQue 多跳问答扩写至更长上下文并加入内部合成数据CodeOpenCodeReasoning、OpenCodeReasoning-2 与 HardTests 竞赛题配合合成测试用例。阶段 2 · 任务形式标准化与改写按训练器和验证器的要求统一任务格式、答案字段与元数据领域标准化做法Math / Knowledge改写为简答题形式Long-Context扩展上下文同时保持问题与参考答案的对应关系Code统一 query 表述、输入输出约定与提交格式阶段 3 · 可验证性过滤只保留答案唯一、可自动校验、抽取格式统一的样本。选择题、判断题、证明题、多问题以及依赖图片的题目都在这一阶段被移除。Long-Context 样本必须有明确的上下文—问题—答案关联Code 样本则必须能在沙箱中通过测试用例执行。阶段 4 · 奖励可信性校验这是奖励信号可靠的关键一环LLM Judge审核题目与答案的一致性Math / Knowledge 由多个独立模型重新求解按共识修正标签——无共识则直接丢弃不做猜测Long-Context 采用参考答案比对 多模型质量评估Code 对测试用例、参考实现与预期输出做三方交叉验证无效或无法执行的用例一律移除。阶段 5 · 难度校准在 RL 初始化 checkpoint 上对每条样本多次 rollout估算经验通过率并据此分层处理通过率 1已完全掌握、无梯度收益→ 移除处于可学习区间→ 保留通过率 0 但标签已确认合法→ 保留交由在线动态采样调控训练频率。注意本阶段只改变难度与采样权重绝不修改参考标签——难度筛选动分数、不动答案。阶段 6 · 格式整理与质量复核导出为统一 JSONL并做发布前最后一道体检检查可解析性、必需字段、唯一 ID、抽取规则与验证器配置清理精确 / 近似重复样本以及与公开评测集重叠的样本去污染复核各领域关键属性Math / Knowledge 答案唯一性、Long-Context 上下文关联、Code 测试用例可执行性记录数据来源、筛选版本与验证器版本保证全程可追溯。 最终成果统一的五字段 JSONL 格式每条样本一行五个字段即可驱动整个 RL 训练循环{ uuid: Math_00001, query: ……完整的题面……, ground_truth: ……参考答案……, source: 原始来源 | UltraData-RL-2609, domain: Math }字段说明uuid全局唯一 ID由领域前缀 序号组成query模型要回答的完整任务长文本任务的上下文和问题都在此字段ground_truth参考答案字符串Code 领域为测试用例对象source原始来源信息domainMath/Knowledge/Long_Context/CodeCode 领域的ground_truth特别值得一提它是一对等长数组inputs/outputs验证完全基于真实执行——把输入喂给候选程序比对标准化后的输出全部测例通过才计为正确。例如两组测例的形式{inputs: [3\n1 2 3\n, 1\n5\n], outputs: [6\n, 5\n]}这种以执行判对错的设计让代码任务的奖励信号几乎不存在歧义。 实战效果AIME 2025 从 61 到 86这套数据的成色有实打实的成绩单背书在 JustRL II 实验设置小模型 critic 的 128K 推理 RL中AIME 2025 在约 300 步 RL 内从 61 提升到 81最终消费该数据集完成后训练的 MiniCPM5-2B checkpoint 在 AIME 2025 上达到86。可验证、可追溯的训练信号正是稳定 RL 的基石。 快速上手指南数据集提供四个 config用 Hugging Facedatasets库即可加载from datasets import load_dataset ds load_dataset(openbmb/UltraData-RL-2609, Math, splittrain) # 也可用 Knowledge / Long-Context / Code仓库内同样提供完整的本地分片文件例如 Math_part-1-of-4.jsonl、Code_part-01-of-12.jsonl、Knowledge_part-1-of-2.jsonl、Long_Context_part-1-of-2.jsonl可结合 README_ZH.md 中的说明直接使用。⚠️ 使用注意事项Code 需自备验证器发布内容包含测试用例但不含沙箱需自行执行提交代码计算奖励静态标签构建时的难度过滤与采样权重不作为字段发布只保留最终入选样本去污染范围有限仅覆盖构建时已知的评测集引入新基准前建议另行检测。✅ 小结UltraData-RL-2609 用一条可判定 → 可信 → 难度适配 → 规范化发布的六阶段流水线把多源原始数据打磨成 85,995 条 RL-ready 样本。它的流水线设计——尤其是多模型共识校验与只调权重不改标签的难度校准原则——对任何想做 LLM RL 后训练的团队都有直接参考价值。项目按 Apache 2.0 许可发布更多细节可参阅 README.md。【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

医院网络时钟系统设计与实施:NTP时间同步方案全解析 2026/9/26 11:52:22

医院网络时钟系统设计与实施:NTP时间同步方案全解析

医院网络时钟系统这个项目,我是在安徽京准的技术团队配合下完成的,整整跑了一个多月现场,把新院区的走廊、护士站、手术室、ICU走了个遍。说实话,在数字化医疗体系里,时间同步是最容易被忽略、但又最容易出事故的基础设…

阅读更多 →
VS+Qt开发中“无法打开源文件ui_*.h”的常见原因与修复方法 2026/9/26 11:52:22

VS+Qt开发中“无法打开源文件ui_*.h”的常见原因与修复方法

做 VSQT 开发的人,几乎没有谁能绕开“无法打开 源 文件 ui_*.h”这堵墙。就在前两天,我同事把一份 Qt 工程拷到新电脑上,用 VS2022 一打开,编译直接抛 C1083,代码里#include "ui_mainwindow.h"那行整条都是红…

阅读更多 →
逻辑回归如何处理非线性边界?特征映射与正则化实战解析 2026/9/26 11:52:22

逻辑回归如何处理非线性边界?特征映射与正则化实战解析

1. 项目定位与整体设计思路 1.1 微芯片质检场景到底在解决什么问题 芯片制造流程中有一道绕不开的环节——出厂前质量检测。每一片微芯片在封装前都要经过一系列电性能测试,测试会得到若干项关键指标,工程师根据这些指标的高低组合判断芯片能否放行。绝…

阅读更多 →
只属于 Creator 用户的代码神器!用 TaoToken 统一 Key 打通 VSCode 与 Cocos Creator 的 TypeScript 工作流 2026/9/26 11:52:22

只属于 Creator 用户的代码神器!用 TaoToken 统一 Key 打通 VSCode 与 Cocos Creator 的 TypeScript 工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
CEF125 x64 H.264发布包实战:CefSharp集成、硬解配置与避坑指南 2026/9/26 11:52:21

CEF125 x64 H.264发布包实战:CefSharp集成、硬解配置与避坑指南

简介:这是一份供 WPF/C# 桌面开发者使用的 CEF 定制发布包,适配 chromium6422 分支的 cef125 系列,支持 x64 环境并内置 H.264 解码能力,适合需要在桌面应用中嵌入浏览器内核、播放网页视频或做 Web 页面承载的开发者。该版本最低…

阅读更多 →
大模型微调到本地部署:基于Qwen2.5的制度条例AI智能体实战 2026/9/26 11:52:08

大模型微调到本地部署:基于Qwen2.5的制度条例AI智能体实战

最近不少朋友跑来问我,老黄(NVIDIA CEO黄仁勋)在公开场合反复强调“数据中心还在热销”,这事跟普通做应用的人到底有什么关系。我的观点是:关系很大。数据中心热销只是外壳,内核是AI算力开始大规模供给&…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉