新闻详情

新闻详情

首页 / 资讯中心 / 详情

DataFlex基准实验解读:动态数据调度对MMLU与困惑度带来多少提升?

发布时间:2026/10/1 23:30:30来源:尧图网络
DataFlex基准实验解读:动态数据调度对MMLU与困惑度带来多少提升?
DataFlex基准实验解读动态数据调度对MMLU与困惑度带来多少提升【免费下载链接】DataFlex可用于大模型训练时动态进行训练动态训练数据选择、领域比例调整及动态加权提升训练速度和性能与 LLaMA-Factory 无缝集成提供灵活强大的训练控制能力。项目地址: https://gitcode.com/OpenDCAI/DataFlexDataFlex 是一个面向大模型训练的动态数据调度开源框架支持训练过程中的动态数据选择、动态数据配比领域比例调整与动态样本加权并与 LLaMA-Factory 无缝集成、即插即用。本文带你解读项目官方基准实验当训练数据被动态调度后在 MMLU 基准与各数据域困惑度PPL上究竟能带来多少提升基准实验怎么搭MMLU 准确率 分域困惑度项目实验分为两组对应大模型训练中两种最常见的数据调度场景实验组训练数据评测指标对应调度方式数据选择 / 动态加权Open-Hermes-2.5 子集SFT与训练数据相关的 MMLU 子集准确率dynamic_select/dynamic_weight数据配比Data MixtureSlimPajama-627B 子集6B 与 30B 两种 token 规模预训练MMLU 准确率 8 个数据域 PPLdynamic_mix 选择实验中的 LESS 与 NICE 使用由 GPT-5 生成推理轨迹的 MMLU 验证集作为验证集配比实验则分别报告 WebCC/C4、StackExchangeSE、Wiki、GitHub、ArXiv、Book 等 8 个域的 PPL便于看出比例调整对哪个领域帮助最大。仓库内附带了可用于快速熟悉数据格式的小型多模态样例。data/mmfinereason_eval_demo.json 中的题目就是 MMLU 基准同款的选项字母单选风格而 data/mmfinereason_sft_demo.json 中则是带链式思维CoT轨迹的训练样本例如这道几何推理题数据配比结果DoReMi 与 ODM 在 MMLU 和困惑度上提升多少配比实验在 6B 与 30B 两个规模上对比三种方法默认比例基线Baseline、三阶段 DoReMi 与在线式 ODM。关键数据如下加粗为该列最优6B 规模Slim-Pajama-6B方法MMLU Acc ↑总体 PPL ↓SEArXivBookBaseline25.274.2173.4023.5084.778DoReMi25.844.1343.7883.4134.661ODM26.044.2443.2432.9044.61330B 规模Slim-Pajama-30B方法MMLU Acc ↑总体 PPL ↓SEArXivBookBaseline25.513.5842.8504.5405.329DoReMi25.973.5622.7064.4415.214ODM25.633.4292.3823.4874.746三个值得记住的结论MMLU 提升约 0.50.8 个百分点6B 规模下 ODM 26.04 对比基线 25.27净提升0.7730B 规模下 DoReMi 25.97 对比 25.51提升0.46。困惑度红利更明显地出现在特定领域30B 规模下ODM 把 ArXiv 域 PPL 从 4.540 压到 3.487降低约 1.05GitHub 域从 3.163 降到 2.255-0.91DoReMi 则更均衡把 6B 规模的总体 PPL 从 4.217 降到 4.134。两种算法各有专长DoReMi离线优化偏向全面改善ODM在线多臂老虎机式调整在代码GitHub、学术ArXiv领域收益显著且规模增大到 30B 后ODM 的总体 PPL 优势进一步扩大3.429 vs 基线 3.584。数据选择与动态加权对比随机基线均胜出在 SFT 场景Open-Hermes-2.5 子集中官方实验逐一评测了动态选择器LESS、NICE、Loss、Delta Loss、TSDS、NEAR 等与动态加权器Loss、ADAPT、Joint-Update-Aware 等。核心结论✅ 所有数据选择算法在 MMLU 子集上的准确率均超过随机选择Random基线✅ 动态重加权同样带来额外增益说明给每条样本动态调权重与动态挑样本一样值得做ℹ️ 各算法的完整对比曲线请查看仓库 README-zh.md 的实验结果章节。复现实验示例配置与一键启动命令上述实验均可由一份 YAML 一条命令复现主要配置如下DoReMi 三步流水线doremi_step1 → step2 动态配比 → step3 静态精调ODM 在线配比odm_dynamic_qwen_pt_full.yaml动态选择LESSless.yaml算法参数注册表components.yaml启动示例dataflex-cli train examples/train_full/mixers/odm_dynamic_qwen_pt_full.yaml动态行为由warmup_step、update_step、update_times三个参数控制——例如先按常规训练一段热身期之后每隔固定步数重新计算一次数据配比或样本权重。完整参数说明见 how_to_use.md。总结从基准实验中得到的 3 点启示 动态数据调度不是银弹但能在相同训练量下稳定换来约0.50.8 个点的 MMLU 提升以及特定领域0.11.0的困惑度下降追求整体语言建模质量可以选DoReMi想重点强化代码、论文等特定领域可以选ODM如果你已在用 LLaMA-Factory迁移到 DataFlex 是即插即用的——直接复用上述基准配置就能跑出自己的第一组数据调度实验。【免费下载链接】DataFlex可用于大模型训练时动态进行训练动态训练数据选择、领域比例调整及动态加权提升训练速度和性能与 LLaMA-Factory 无缝集成提供灵活强大的训练控制能力。项目地址: https://gitcode.com/OpenDCAI/DataFlex创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Java图书管理系统实操:JDBC连接MySQL与核心代码详解 2026/10/2 0:11:58

Java图书管理系统实操:JDBC连接MySQL与核心代码详解

不搞花架子,直接说项目本身。图书管理系统是Java入门到进阶阶段出现频率最高的练手项目,同时也是很多计算机专业课程设计和毕业设计的首选题目。这个项目题目里有两个关键词:一是完整代码实现,二是连接MYSQL数据库。前者说明需要的…

阅读更多 →
Go Web框架选型指南:Gin、Echo、Fiber、Chi对比与实战避坑 2026/10/2 0:11:51

Go Web框架选型指南:Gin、Echo、Fiber、Chi对比与实战避坑

先说个现象:现在只要一搜“Go Web框架”,满屏都是Gin的教程,新手基本闭眼入Gin,老手则各有各的执念——有人非Echo不用,有人抱着Chi不放,还有人直接拿标准库硬写。说实话,这些选择背后都有道理&…

阅读更多 →
AI框架命名规范与技术可信性验证指南 2026/10/2 0:11:37

AI框架命名规范与技术可信性验证指南

我无法生成关于“The ACToRS in AI Framework”的博文内容。原因如下:该标题“ACToRS in AI Framework”在当前公开、主流、可验证的技术文献、学术会议(如NeurIPS、ICML、ACL、CVPR)、开源社区(GitHub、Hugging Face、PyTorch Ec…

阅读更多 →
Agent开发核心五件事:业务边界、编排、记忆、工具与评测 2026/10/2 0:11:37

Agent开发核心五件事:业务边界、编排、记忆、工具与评测

1. 第一件事:把业务需求翻译成Agent能执行的任务边界接手Agent开发快两年,中间做过客服问答、工单流转、数据分析、内部知识库、业务流程自动化等各种类型的项目,也接触过不少企业级的数据Agent平台。说句实话,真正拉开项目成败差…

阅读更多 →
Chrome黑暗模式四大实现方案与底层渲染原理 2026/10/2 0:09:13

Chrome黑暗模式四大实现方案与底层渲染原理

1. 为什么Chrome原生不提供“一键黑暗模式”开关?这4种方法背后是浏览器渲染机制的博弈你打开Chrome,翻遍设置菜单,找不到那个熟悉的“深色主题”滑块——不是你眼花了,而是Google从Chrome 76开始就刻意把系统级黑暗模式支持做成了…

阅读更多 →
UGUI与粒子特效显示层级冲突:原理剖析与四种解决方案 2026/10/2 0:09:06

UGUI与粒子特效显示层级冲突:原理剖析与四种解决方案

做游戏界面的时候,我几乎每隔一段时间就会碰到同一条报错:一堆UI按钮叠得好好的,结果画面里放个粒子特效,不是被界面盖住,就是把按钮全糊住了。老手一看就知道是UGUI和粒子特效的显示层级问题,但头一回遇到…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉