新闻详情

新闻详情

首页 / 资讯中心 / 详情

UltraData-RL-2609 许可证与数据合规须知:Apache 2.0、上游许可与新基准去污完整指南

发布时间:2026/9/25 21:22:30来源:尧图网络
UltraData-RL-2609 许可证与数据合规须知:Apache 2.0、上游许可与新基准去污完整指南
UltraData-RL-2609 许可证与数据合规须知Apache 2.0、上游许可与新基准去污完整指南【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609UltraData-RL-2609 是 OpenBMB 开源社区发布的可验证奖励强化学习RLVR数据集共 85,995 条训练样本覆盖数学推理、科学知识推理、长上下文理解与代码生成四大方向是 MiniCPM5-2B 后训练的核心 RL 数据。在开始使用之前务必花 5 分钟读完这份许可证与数据合规须知——它直接关系到你能否合法地训练、分发和商用这份数据以及如何避免评测成绩虚高的去污陷阱。 本文面向新手与一般用户不涉及大量代码重点讲清楚数据能用在哪、受哪些许可证约束、如何合规发布派生物、去污范围意味着什么。一、这份数据集到底是什么为什么合规很重要UltraData-RL-2609 不是单一来源的数据而是由多个公开数据集混合、改写、过滤后得到的合成与增强数据属于 UltraData L0-L4 分级框架中的L3 层。数据文件按领域分片存放在仓库的 data/ 目录下领域样本数来源构成数据文件Math32,412DAPO、DeepScaleR、DeepMath 并集Math 分片Code23,665OpenCodeReasoning 系列 HardTestsCode 分片Long-Context18,046HotpotQA、Qasper、MuSiQue 扩写 内部合成Long_Context 分片Knowledge11,872OpenScienceReasoning-2 改写Knowledge 分片因为它是多源混合 人工/模型改写的产物每条数据可能同时受两份许可证约束本项目的 Apache 2.0加上其上游原始数据集的许可证。这也是本文接下来两节要拆解的核心问题。二、Apache 2.0 许可证允许你做什么本项目整体按 Apache License 2.0 发布完整的法律条款见仓库根目录的 LICENSE 文件。对新手来说Apache 2.0 可以概括为最友好的一类开源许可证核心要点如下✅免费使用可永久、全球范围内、免许可费地复制、使用、修改、分发数据和派生作品✅可商用可以用这份数据训练自己的模型并商用也可以闭源发布你基于它开发的产品✅可再分发允许你把数据含修改版分享给他人或集成到其他项目⚠️四个附条件义务分发时必须做到向接收方提供一份许可证副本修改过的文件要注明你修改了什么保留源文件中的版权、专利与商标声明若原项目带有 NOTICE 文件你的派生物也需保留其中的署名信息。一句话总结Apache 2.0 给你的自由度很大代价只是保留署名与条款。三、上游许可MIT、CC BY 4.0 与 CC BY-SA 4.0 会跟数据走这是最容易踩坑的一点。项目 README 中明确写道上游数据集分别采用MIT、CC BY 4.0、CC BY-SA 4.0许可对由其派生的内容继续适用。Apache 2.0 不会覆盖或取代这些条款。原文见 README.md 的License and Data Sources一节通俗理解就是——许可证像基因一样附着在数据内容上Apache 2.0 只约束本项目新增的部分不能洗掉上游许可证。三者的关键差异上游许可证核心要求你需要做什么MIT宽松型仅要求保留版权声明与许可文本分发时附上 MIT 声明即可CC BY 4.0署名即可允许商用与修改注明原作者/来源出处CC BY-SA 4.0署名 相同方式共享ShareAlike你基于这些内容再发布的衍生数据集必须采用相同或兼容的 CC BY-SA 4.0 许可不能闭源独占实践建议如果你只是用数据训练模型模型权重与输出通常不受 CC BY-SA 传染但如果你重新打包、清洗后再次发布一份衍生数据集其中源自 CC BY-SA 4.0 上游的那部分内容必须同样以 CC BY-SA 4.0 开放。拿不准时建议按最严格条款处理并保留来源标注。四、转载红线禁止未授权的原样转载与商业重打包README 中对转载有明确的红线条款README.md、README_ZH.md❌ 未经原作者或本组织事先书面许可任何机构、组织或第三方平台严禁直接转载、镜像、重新托管本项目产物❌ 严禁对数据产物进行商业化重新包装后再发布。换句话说你可以在自己项目中下载、使用、微调这份数据但不能把整个数据集原样搬到自己的平台或 CDN 上更不能把它包装成自家独家数据售卖。想要正式转载或商用分发先联系项目方获取书面授权。五、新基准去污评测前请自行检查一遍去污decontamination指确保训练数据里不含评测集原题否则模型考试作弊成绩虚高。项目方在构建流程的第 6 阶段已做过一轮清洗导出统一 JSONL 并复核必需字段、唯一 ID清理精确重复与近重复样本移除与公开评测基准重叠的样本即去污步骤记录来源、筛选版本与验证器版本保证可追溯。但该检查只覆盖构建时已知的评测集README 的Notes and Limitations一节明确说明Decontamination scope: Screening covered evaluation sets known at construction time。因此官方给出的合规建议是在你引入新的评测基准之前请重新跑一遍去污检查。具体操作很简单用你新基准的题目或答案与训练集做文本相似度/精确匹配比对命中即剔除对应样本。这是保证你 RL 训练后评测成绩真实可信的必要一步。六、合规清单使用前自查 5 件事 把下面这张清单存档发布产品前逐项打勾保留许可证项目内保留 LICENSE 文件及版权/署名声明遵守上游条款涉及 CC BY 的内容注明出处CC BY-SA 的派生数据以相同条款开放不原样转载未获书面授权前不镜像、不托管、不商业重打包整个数据集Code 数据需自备验证器发布内容含测试用例但不含沙箱需自行执行提交代码计算奖励详见 README.md Notes and Limitations;新基准先去污引入任何新的评测集前先做重叠检测。七、引用与数据文件索引如果你在研究中使用了这份数据README 提供了 BibTeX 引用格式见 README.md 的 Citation 一节作者为 MiniCPM Team2026 年发布。数据文件索引数学样本4 个分片data/Math/代码样本12 个分片data/Code/长上下文样本2 个分片data/Long_Context/知识样本2 个分片data/Knowledge/中英文文档README.md / README_ZH.md许可证全文LICENSE总结UltraData-RL-2609 以 Apache 2.0 授权自由度高、可商用但三条规则不能忘——上游许可跟数据走CC BY-SA 部分需同源共享、禁止未授权原样转载、新基准评测前自行去污。做到这三点你就能合规、干净地把这份 8.6 万条高质量 RL 数据用进自己的模型训练流水线。【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Ragent树形意图识别:如何让问题被精准路由到正确的知识库 2026/9/25 21:57:34

Ragent树形意图识别:如何让问题被精准路由到正确的知识库

Ragent树形意图识别:如何让问题被精准路由到正确的知识库 【免费下载链接】ragent 企业级 Agentic RAG 智能体 - 全链路覆盖文档解析、多路检索、意图识别、问题重写、会话记忆、MCP 工具调用与深度思考。面向真实业务场景,从 0 到 1 完整工程实现。 项…

阅读更多 →
7个开箱即用的AI员工:搭建短视频自动剪辑与运营流水线 2026/9/25 21:57:21

7个开箱即用的AI员工:搭建短视频自动剪辑与运营流水线

去年底我一度被三平台账号的日更逼到怀疑人生:白天改稿,晚上剪片,凌晨还在回私信。最崩溃那天,一天要剪六条视频、写八条文案、排四张排期表,整个人像被琐事活埋了。后来我把整个流程拆成一个个岗位,再给每…

阅读更多 →
AI Agent Harness Engineering 在供应链:预测、补货与异常处理 2026/9/25 21:57:08

AI Agent Harness Engineering 在供应链:预测、补货与异常处理

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
人才盘点岗位能力拆解:数据分析、九宫格模型和Excel的优先级怎么排 2026/9/25 21:56:27

人才盘点岗位能力拆解:数据分析、九宫格模型和Excel的优先级怎么排

截至2026年9月秋招季,人才盘点岗位对校招生的硬性能力门槛是Excel数据处理加对九宫格、360评估等方法论的基本理解,数据分析能力是面试中区分度最高的考察项,直接问工具操作细节的面试题正在增多。 智联招聘2026年9月发布的一份组织发展管培生…

阅读更多 →
Java核心基础拆解:从JDK配置到高频面试题的系统学习路线 2026/9/25 21:56:20

Java核心基础拆解:从JDK配置到高频面试题的系统学习路线

1. 把Java核心基础拆开看:它在学什么,为什么面试总绕不开先说个我观察到的现象:只要你在搜索引擎里敲下“Java”三个字,下拉联想永远是“Java基础”“Java面试题”“Java学习路线”“Java八股文”这几个词轮番出现。这说明什么&am…

阅读更多 →
BP-Adaboost:用BP神经网络作为弱学习器的集成方法 2026/9/25 21:56:06

BP-Adaboost:用BP神经网络作为弱学习器的集成方法

简介:本资源是一个基于C#实现的BP-AdaBoost集成学习算法项目,面向机器学习初学者与Windows平台开发者,聚焦于强分类器构建与预测任务,特别适用于皮肤病变等二分类场景的建模实践。压缩包共46个文件,包含7个C源码&#…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉