新闻详情

新闻详情

首页 / 资讯中心 / 详情

DataFlex与DataFlow组合指南:从原始数据到动态调度的完整数据为中心训练管线

发布时间:2026/10/2 7:03:03来源:尧图网络
DataFlex与DataFlow组合指南:从原始数据到动态调度的完整数据为中心训练管线
DataFlex与DataFlow组合指南从原始数据到动态调度的完整数据为中心训练管线【免费下载链接】DataFlex可用于大模型训练时动态进行训练动态训练数据选择、领域比例调整及动态加权提升训练速度和性能与 LLaMA-Factory 无缝集成提供灵活强大的训练控制能力。项目地址: https://gitcode.com/OpenDCAI/DataFlexDataFlex是一个构建在 LLaMA-Factory 之上的数据为中心Data-Centric大模型动态训练框架能在训练过程中动态完成训练数据选择、领域比例调整与样本动态加权从而提升 LLM 训练的速度与性能而DataFlow是它的上游搭档负责把原始文件加工成标准训练数据。两者独立、零代码依赖仅通过标准 JSON 数据格式衔接组合起来就是一条从原始数据到动态调度的完整训练管线。本指南将带你用最少的配置跑通这条管线。 DataFlow 与 DataFlex 的分工为什么需要组合传统 LLM 训练流程是先处理数据再开训训练开始后数据就固定不变了。DataFlex DataFlow 的组合把这条流程拆成两个可独立演进的阶段阶段项目职责核心能力数据生产DataFlow原始文件 → 训练数据文档解析、知识清洗、QA / CoT 合成、训练格式转换等可组合算子数据调度DataFlex训练数据 → 动态训练动态数据选择、动态领域配比、动态样本重加权两个项目彼此独立没有代码依赖DataFlex 也接受来自任意来源的数据——DataFlow、人工标注、HuggingFace 数据集或自定义脚本均可。这意味着你可以只升级其中一侧另一侧保持不变。 第一步用 DataFlow 把原始数据变成训练数据DataFlow 通过可组合的算子工作流完成转换文档解析、知识清洗、问答/思维链合成、训练格式转换。产出的 JSON 可以直接喂给 DataFlex 训练。拿到 DataFlow 的产物后只需在 DataFlex 侧做一件小事把数据集注册到 data/dataset_info.json。该文件定义了数据集名称、文件名与字段映射如prompt/response/images仓库里已附带多组演示数据例如data/mmfinereason_sft_demo.json多模态 SFT 演示数据含图片与思维链回答data/mmfinereason_eval_demo.json评测演示数据data/wiki_demo.jsonl 与 data/c4_demo.jsonl预训练风格的文本演示数据下面这张图就来自演示数据中的多模态 SFT 样本展示了 DataFlow 输出的训练样本中图文结合的典型形态 提示演示数据文件与图片都在 data/ 目录下图片以相对路径如figures/00000_0.jpg被数据文件引用这是 DataFlow 产物接入 DataFlex 的标准约定。 第二步安装并启动 DataFlex 动态训练先安装 PyTorch再安装 DataFlexpip install dataflex或从源码安装开发场景git clone https://gitcode.com/OpenDCAI/DataFlex cd DataFlex pip install -e .环境要求 Python 3.11需要 DeepSpeed 的配置请追加安装dataflex[deepspeed]。启动命令与 LLaMA-Factory 几乎一致只是把入口换成dataflex-cli traindataflex-cli train examples/train_lora/selectors/less.yaml与原生 LLaMA-Factory 唯一的区别是YAML 里需要额外声明 DataFlex 特有参数其中最关键的两个字段是train_type训练模式和component_name算法名。完整字段说明见 skills/how_to_use.md。⚙️ 第三步为管线选择动态调度策略DataFlex 提供三类调度器覆盖选哪些样本、各域占多少、每个样本权重多大三个层面的数据决策1️⃣ 动态数据选择dynamic_select—— 定期暂停训练按策略重新挑选样本再继续训练算法类型说明LESS / NICE基于梯度与验证集梯度对齐挑高价值样本Loss / Delta Loss基于损失按当前或滑动窗口损失选难样本TSDS / NEAR基于分布离线预计算概率或近邻索引训练时零开销Random随机基线对照2️⃣ 动态数据配比dynamic_mix—— 训练中途调整各数据域的采样比例例如 ODM 用多臂老虎机在线探索DoReMi 用三步流程离线优化域权重。可参考示例 examples/train_lora/mixers/doremi_step2_dynamic_qwen_pt_lora.yaml。3️⃣ 动态样本重加权dynamic_weight—— 不改样本集合只在反向传播时动态调整每条样本的损失权重如 loss 重加权、批次感知的 Joint-Update-Aware。所有算法的超参数统一收敛在 src/dataflex/configs/components.yaml 中管理训练 YAML 只需通过component_name指向算法名即可示例配置分布在 examples/train_lora/ 与 examples/train_full/ 下的 selectors / mixers / weighters 子目录。需要评测集的场景注意LESS、NICE、ADAPT 等依赖验证/锚点集的算法需要在配置中指定eval_dataset。DataFlow 产物之外仓库自带了可直接注册的评测演示数据例如图中的相图问答样本✅ 组合使用建议清单格式先行DataFlow 输出必须是标准 JSON并先在 data/dataset_info.json 中注册好字段映射再交给 DataFlex。多域数据才用 mixerdynamic_mix要求dataset字段用逗号列出多个数据集如wiki_demo,c4_demo单数据集场景用 selector 或 reorder 更合适。步数语义要心里有数动态训练以 step 为节奏warmup_step/update_step/update_times一个 Flex epoch warmup_step update_step × update_times细节见 skills/how_to_use.md。平滑迁移不写train_type或设为static时DataFlex 退化为默认 LLaMA-Factory 训练器可无缝对照基线。 小结DataFlow 解决数据从哪来DataFlex 解决数据怎么用前者把原始文件加工成标准训练 JSON后者在训练循环内动态执行数据选择、领域比例调整与样本加权。两者通过标准数据格式松耦合衔接组合后即可获得一条从原始数据到动态调度的完整数据为中心训练管线——这正是 DataFlex 论文NeurIPS 2026 收录所验证的、能同时提升训练效率与模型性能的核心思路。【免费下载链接】DataFlex可用于大模型训练时动态进行训练动态训练数据选择、领域比例调整及动态加权提升训练速度和性能与 LLaMA-Factory 无缝集成提供灵活强大的训练控制能力。项目地址: https://gitcode.com/OpenDCAI/DataFlex创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Spring Boot 3.x 静态资源404与getHttpServletMapping错误解析 2026/10/2 7:50:50

Spring Boot 3.x 静态资源404与getHttpServletMapping错误解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
中软外包华为首月技术成长实录:从执行者到问题定义者 2026/10/2 7:50:50

中软外包华为首月技术成长实录:从执行者到问题定义者

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
加权最小二乘法:异方差矫正的原理、诊断与实战 2026/10/2 7:50:50

加权最小二乘法:异方差矫正的原理、诊断与实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Yocto下载慢怎么办?清华镜像与PREMIRRORS双管齐下加速构建 2026/10/2 7:50:50

Yocto下载慢怎么办?清华镜像与PREMIRRORS双管齐下加速构建

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
大模型训练优化器全解析:从SGD到AdamW与Muon的实战指南 2026/10/2 7:50:50

大模型训练优化器全解析:从SGD到AdamW与Muon的实战指南

1. 大模型训练里优化器到底在干什么很多人第一次接触大模型训练,注意力全在模型结构、参数量、数据配比上,优化器往往被当成一个“调参黑盒”——反正就是AdamW,学习率设个1e-4或者3e-4,跑就完了。但真到了训练不稳定、loss突然起…

阅读更多 →
ESP32参考方案五层优先级决策模型 2026/10/2 7:50:24

ESP32参考方案五层优先级决策模型

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉