新闻详情

新闻详情

首页 / 资讯中心 / 详情

北大开源,强化学习数据策略接入更简单、对比更公平

发布时间:2026/9/29 15:02:30来源:尧图网络
北大开源,强化学习数据策略接入更简单、对比更公平
北大发布DataFlex-RL开源灵活调试强化学习数据策略每一轮强化学习到底应该把哪些数据交给模型这个问题正随着推理模型和 RLVR 的发展变得更加重要。随着强化学习在大模型后训练中的作用不断增强模型练什么、怎么练也需要更仔细地安排。一道题可能起初很难训练一段时间后却能稳定答对。哪些数据该继续保留学习权重和领域配比该怎样调整都需要结合模型的训练状态重新考虑。而数据策略方法往往不止一种如何把不同方法比较清楚还有一些实际难题。不同方法各有一套实现换个筛选规则就可能要改训练器比较效果时模型、奖励函数和训练预算又未必一致。即使分数提高了也很难判断收益究竟来自数据策略还是其他训练设置。为了解决数据策略接入和效果比较中的麻烦问题北大DCAI团队联合UCAS、上海算法创新研究院、中关村学院最新发布DataFlex-RL。GitHub 开源仓库https://github.com/haolpku/DataFlex-RL论文地址https://huggingface.co/papers/2609.06107少花时间反复修改训练器多留精力验证数据策略是否有效是DataFlex-RL最直接的价值。DataFlex-RL复用verl的训练流程把数据选择、样本重加权和领域配比调整做成可配置组件让开发者可以在同一套RLVR/GRPO流程中配置三类动作选择哪些rollout参与当前更新给样本或token分配多大的学习权重决定下一批数据从哪些领域采样。这些策略直接复用 RL 循环已经产生的奖励、优势、token 概率和 prompt 分组等信号rollout、验证和策略更新代码基本保持不变。论文发布后获得了社区的关注并登上HuggingFace #2 Paper of the day。论文中组织了591次实验在多种模型和数学、逻辑、科学任务上检验数据策略。三大动态数据策略维度选择、加权、混合在GRPO训练中模型会对同一道题生成多个回答由验证器给出奖励再根据组内奖励差异更新模型。DataFlex-RL将数据策略分成三类选择决定哪些回答参与当前更新加权调整它们对更新的贡献混合根据历史反馈改变后续批次的领域构成。数据选择控制哪些回答参与策略更新同一道题生成的回答提供的学习信号可能很不相同。在基于组内奖励差异的 GRPO 中一组回答全部正确或全部错误通常无法形成有区分度的 advantage。DataFlex-RL 支持按组内解出率、advantage 排名、奖励方差和回答效率进行筛选。difffilter是一个具体例子每道题生成五个回答只保留解出率严格处于0.2与0.8之间的组也就是答对两个或三个的情况将更新集中到中间难度的题目。maxvar保留组内奖励方差最大的子集gfpo按奖励与回答长度的比值选择topk保留advantage幅值排名靠前的回答。这里筛选的是已经生成的回答当前实现通过0/1权重控制策略损失因此不会减少已经发生的生成成本。评估效率时还需要关注实际参与更新的数据量。动态重加权调整不同样本的学习强度有时研究者希望保留当前批次中的全部回答同时让部分样本承担更大的更新权重重加权就用于这种情况。DataFlex-RL 支持回答级和 token 级权重softmax、per根据advantage幅值调整回答贡献diffband对奖励落在指定分位区间内的样本加权ar利用已有token概率对低概率token施加相对较低的权重。这些方法会将权重均值归一到1尽量控制整体损失尺度的变化。动态领域混合根据历史表现调整配比数学、逻辑和科学任务的学习进度可能不同固定比例未必适合每个阶段。DataFlex-RL用滑动窗口累计各领域的训练反馈再由mixer更新后续批次的目标比例。混合策略会先在warmup阶段积累反馈再按配置的间隔更新比例。当前插件通过自定义replay buffer从可用样本中按领域选取实际进入训练的数据还会受到各领域候选数量的限制因此需要同时观察目标比例和实际数据分布。统一技术架构让数据策略灵活接入训练三类策略作用的位置不同都需要接入训练流程、读取反馈再把判断转成具体操作。DataFlex-RL通过verl插件接入训练复用已有信号并将打分与执行分开让策略组件可以独立替换。插件化接入复用verl训练流程要比较不同数据策略首先需要让它们在同一套训练流程里运行。DataFlex-RL以插件形式接入verl通过注册机制提供自己的trainer。对于选择和加权插件在原有advantage计算完成后读取信号运行数据策略再将结果写入verl已有的 rollout_is_weights字段。选择结果转成0/1权重加权策略返回连续权重两者都由现有策略损失接口处理。领域混合使用单独的trainer与自定义replay buffer累计反馈并按更新后的领域比例选取可用样本。不同策略共用模型生成、奖励验证和模型更新流程改动集中在数据策略的接入位置。开发者新增方法时可以沿用这些训练能力把主要工作放在策略组件上。当前插件面向verl v1 trainer接口使用前需要确认宿主版本兼容、插件能够正常注册。共享训练信号减少重复打分接入训练之后策略还需要判断依据。奖励反映回答表现advantage提供策略更新信号token log-prob记录 token 概率。这些数据已经随训练产生scorer可以直接读取并计算所需分数。策略不需要为了打分额外执行一次模型前向可以复用相同的信号处理代码。共享的是信号来源和计算逻辑并不要求所有策略使用同一个分数领域混合还需要把反馈按领域累计成历史统计。训练过程还会记录保留比例、权重统计、领域目标比例和反馈方便检查策略是否按预期运行。打分与执行解耦通过组件替换策略有了分数接下来才是决定怎样使用它。DataFlex-RL将这两步分别交给Scorer和Actuator。Scorer根据输入信号计算分数执行器将分数转换成保留索引、连续权重或领域比例。有了分数接下来才是决定怎样使用它。同一份advantage幅值分数可以交给topk做筛选也可以交给softmax生成连续损失权重。组件按名称注册再通过配置组合基于已有信号新增筛选方法时通常只需实现执行规则需要新的判断依据时再扩展scorer。实验结果从基础训练增益到动态数据调度论文共进行了591次实验覆盖不同基础模型以及数学、逻辑和科学任务。核心实验在Qwen2.5-7B-base上展开包含13个配置每个配置使用12个配对随机种子共完成156次运行。实验先确认GRPO能够有效训练模型再观察三类数据策略如何参与后续训练。在Qwen2.5-7B-base上未训练模型的平均得分为42.01采用均匀采样的标准GRPO基线训练后提升到49.77平均提升7.76个百分点。在Llama-3.1-8B-base上模型也从10.87提升到21.12平均提升10.25个百分点。这组结果建立了后续实验的参照系GRPO 带来基础训练增益数据策略继续安排回答、学习权重和领域配比。选择和重加权实验覆盖difffilter、maxvar、gfpo、topk、ar、per、softmax 和 diffband。它们从回答筛选、样本权重和 token 权重等角度调整训练信号在相同模型、数据和训练预算下进行比较。领域混合实验中reward_gap、dump_ucb和tscl根据领域奖励差距、探索反馈和训练变化速度更新后续批次的采样比例。相对于固定等比例混合三种方法的平均提升分别为0.45、0.61和0.16个百分点展示了根据训练反馈调整领域配比的方式。在Llama-3.1-8B-base上论文继续测试选择、重加权和领域混合配置验证同一套组件能够迁移到不同模型并沿用相同的训练与评测流程。此外Table 8从评测侧补充了这一比较覆盖数学、逻辑和科学三个领域时不同完整汇总方式得到的结果整体较为接近调整评测覆盖范围后方法排序也会发生变化。这些实验展示了DataFlex-RL的工作闭环训练时读取奖励、优势和token概率等已有信号动态调整当前批次的样本选择与学习权重或更新后续批次的领域配比验证时通过配置切换策略沿用同一套训练和评测流程记录执行过程并比较结果。DataFlex-RL不仅提供了一个动态训练框架还提供了一个有效的验证接口方便研究者观察数据调度在不同模型、任务和训练阶段中的实际作用。从更大的AIData生态看北大DCAI团队此前已经开源DataFlex并支持与LLaMA-Factory无缝集成覆盖Select、Mix、Reweight和Reorder等数据操作。DataFlex-RL则将这套数据灵活处理思路进一步延伸到 RLVR/GRPO 训练过程根据训练反馈动态调度rollout和领域数据。两套工具形成互补共同覆盖从数据准备到强化学习更新的更多环节让数据策略更方便地进入实际训练流程。原文链接日榜第二北大开源强化学习数据策略接入更简单、对比更公平-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

aigc率检测前必看!2026年十款热门降ai率工具深度测评,带你把ai率降至个位数 2026/9/29 20:50:06

aigc率检测前必看!2026年十款热门降ai率工具深度测评,带你把ai率降至个位数

在写毕业论文那时候真的很容易心态崩溃,经常是查重率过了,但是回头一检测AIGC率直接飙红,根本无从下手,网上找了各种方法,用市面上的工具都尝试了一遍。 今天这篇文章是帮大家不用费时费力去找方法,避开我…

阅读更多 →
LLM 模型选型框架实战:用 TaoToken 统一 Key 跑通能力、延迟、成本、合规四维评估 2026/9/29 20:50:05

LLM 模型选型框架实战:用 TaoToken 统一 Key 跑通能力、延迟、成本、合规四维评估

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Codex 能写代码却无法完成交付?从验证闭环判断 Plus 还是 Pro 2026/9/29 20:50:04

Codex 能写代码却无法完成交付?从验证闭环判断 Plus 还是 Pro

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
植物生理状态实时解码:温室健康监测系统设计 2026/9/29 20:50:04

植物生理状态实时解码:温室健康监测系统设计

1. 项目概述:这不是一个“花哨的传感器盒子”,而是一套能听懂植物语言的田间翻译官“Greenhouse Plant Health & Growth Monitor”——光看这个标题,很多人第一反应是“又一个IoT农业项目”,顺手划走。但我在山东寿光连栋温室…

阅读更多 →
别再对着空白文档发呆:物流工程论文的 AI 搭子选择就是笔乐颂AI 2026/9/29 20:50:03

别再对着空白文档发呆:物流工程论文的 AI 搭子选择就是笔乐颂AI

先说一个物流工程同学特别熟悉的场景: 你要做一份关于城市冷链共同配送中心选址与末端车辆路径优化的毕业研究。听起来就很 “物流工程”—— 既要分析订单密度、温控成本、时效要求,又要建选址模型或 VRP 路径模型,还要跑数据、画路线图、写…

阅读更多 →
2026重庆真石漆公司怎么选择? 2026/9/29 20:49:56

2026重庆真石漆公司怎么选择?

一、行业通用定义与权威溯源根据相关国家标准及行业技术规范,真石漆是一种装饰效果酷似大理石、花岗岩的涂料。主要由天然彩砂、乳液、助剂等构成,通过喷涂施工,能呈现出天然石材的色泽和纹理,广泛用于建筑外墙装饰。二、核心分类…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉