新闻详情

新闻详情

首页 / 资讯中心 / 详情

大模型微调实践:数据构建、LoRA 调参与训练评估

发布时间:2026/9/30 10:19:40来源:尧图网络
大模型微调实践:数据构建、LoRA 调参与训练评估
上一章讲了SFT、DPO、PPO、GRPO的原理这里再讲讲数据怎样组织、参数怎样理解、效果怎样判断。建议先用较小模型加 LoRA 验证数据与实验设置再迁移到更大模型。一、SFT Supervised Fine-Tuning监督微调做法准备一批 提示词 → 标准答案 的高质量配对数据让模型像学生背范文一样去模仿学习。输入(prompt, 理想回答) pairs目标最大化模型生成 理想回答 的概率特点最简单、最基础通常是预训练之后、对齐之前的第一步建议先使用小参数量大模型lora验证试验设置和数据是否有效如果有效的话迁移到大参数量大模型验证scaling law即随着模型参数量增加模型效果是否越好这样做可以显著加快迭代效率避免在大参数模型上做无意义迭代。自拟的最小教学样例不是原图业务事实也不是生产数据集。每个代码块是一个完整 JSON 对象。若保存为 JSONL每个对象应压成一行参考问答学会使用材料而不是补造条件{ messages: [ {role: system, content: 仅依据提供的材料回答材料不足时明确说明。}, {role: user, content: 材料活动入口在首页仅对符合条件的用户显示。问题为什么我看不到入口}, {role: assistant, content: 该入口仅对符合条件的用户显示。现有材料未说明具体条件无法判断你未看到入口的原因。} ] }角色扮演既要语气一致也要多轮事实一致{ messages: [ {role: system, content: 你扮演虚构的图书管理员小林语气温和记住对话中已表达的偏好。}, {role: user, content: 我喜欢短篇不喜欢恐怖故事。}, {role: assistant, content: 记住了我们可以从温暖、轻松的短篇故事开始。}, {role: user, content: 那该优先选什么类型}, {role: assistant, content: 可以优先选生活题材的短篇故事避开恐怖主题。} ] }文本分类输出空间必须一致{ messages: [ {role: system, content: 将咨询分为物流查询、催退款、使用咨询只输出一个标签。}, {role: user, content: 退款已经申请了怎么还没处理}, {role: assistant, content: 催退款} ] }文案生成写法之外还要守住约束{ messages: [ {role: system, content: 只输出一个标题不超过20个字符不补充未提供的产品功效。}, {role: user, content: 为一款可折叠、便于携带的帆布袋写一个朴素标题。}, {role: assistant, content: 可折叠帆布袋轻松随行} ] }训练掩码提醒messages 格式本身不保证“只训练 assistant”。例如 TRL 的 assistant_only_loss 配置需要相应聊天模板支持prompt-completion 的损失范围又有不同设置。实际开训前应检查渲染后的文本、token 与 labels确认正确答案没有被截断非训练位置被正确屏蔽。二、SFT 与 LoRA 调参Epoch含义模型训练的总轮数表示模型看过多少遍数据。一个 epoch 通常表示遍历一次训练集。经验一般尝试25轮创作类任务可考虑510轮。判断方法可以观察loss曲线来判断是否需要调整过拟合训练集的loss下降验证集loss上升说明模型已经过拟合应该停止训练未收敛训练集和验证集的loss都在缓慢下降说明模型还未收敛可以继续训练特殊场景对于小说创作、文案生成等任务loss无法反应上下文逻辑和风格根据经验可以将epoch适当增大例如设置510轮LoRA rank 与 alphaalpha决定缩放模型权重rank决定lora训练参数量大小标准 LoRA 冻结基座权重 W₀学习低秩增量。简化写法为r 是 rank控制低秩分解的维度对同样的目标层r 越大适配器参数通常越多。alpha 参与增量分支缩放不是把整个模型的原始权重乘上 alpha。总可训练参数量还受目标层、bias 和额外可训练模块影响。推荐组合rank 64alpha 6;rank 32alpha 4;Learning rate学习率控制更新步幅设置过高模型可能陷入局部最优或者过拟合设置过低会减慢训练速度可能导致训练不收敛。经验值lora:1e-5~5e-5;全量sft:1e-5~2e-5Warmup学习率预热通常让训练初期的学习率从较低值逐步升到目标水平。通常保持默认值即可如果在训练初期遇到loss不降可以尝试调大warmup step rate观察loss是否开始下降Enable save models设置保存最后几个产物checkpoint不直接影响模型效果。最佳 checkpoint 不一定是最后一个在实验调参阶段可以多保存几个版本以便从中选择最佳的checkpoint 但是保存更多的模型会增加训练总时长三、DPO 数据Direct Preference Optimization直接偏好优化做法不给 标准答案而是给同一个 prompt 配一对回答 —— 一个好的、一个差的让模型学会 选好的、躲差的。输入(prompt, 更好的回答 chosen, 更差的回答 rejected)目标拉大 chosen 和 rejected 之间的概率差距特点不需要单独训练一个奖励模型也不需要在线采样强化学习直接用一个简单的分类式损失就能完成偏好对齐所以便宜、稳定、好训练DPO 可用于回答质量、表达风格、代码可读性、边界遵循等偏好优化。当模型输出的质量风格不符合预期例如会输出不安全的内容或者目标数据难以大量生产或者标注例如需要模型输出幽默风趣的句子会消耗大量人力时间来构建这种数据可以使用直接偏好优化方法来调整参数使得模型输出和目标偏好差异减少。数据格式{ messages: [ {role: system, content: 回答要具体、友好不指责提问者。}, {role: user, content: 刚开始学Python先练什么}, {role: assistant, chosen: 先练变量、条件和循环再写一个简单的小程序。, rejected: 自己去看文档就行。} ] }在 TRL 的显式 prompt 对话格式中相同内容应拆为顶层 prompt、chosen、rejected{ prompt: [ {role: system, content: 回答要具体、友好不指责提问者。}, {role: user, content: 刚开始学Python先练什么} ], chosen: [{role: assistant, content: 先练变量、条件和循环再写一个简单的小程序。}], rejected: [{role: assistant, content: 自己去看文档就行。}] }底层 score用于建立偏好次序不等于在线奖励可以给同一提示下的多个候选回答标 score平台据此生成两两偏好对同分回答不形成偏好对。图中三个分数为0.5、0.1、1按照较高分更受偏好的规则得到10.5、10.1、0.50.1共三对。不要由此推断“有 score 就是在做 PPO”。这里是将已有候选排序后构造 DPO 数据若实现只取次序分差是否进入损失权重还要看实现。四、强化学习强化学习的共同循环是采样回答 → 评分 → 计算学习信号 → 更新策略 → 再采样。强化学习模型通过“行动-反馈-调整”的循环过程最大化未来获得的奖励信号。与记忆单个样本的正确答案不同模型会探索多个可能答案接受每个答案的数值奖励并逐步调整行为模式使高奖励答案的生成概率提升低奖励答案的生成概率下降。经过多轮迭代后模型会收敛至最优策略——符合奖励信号定义的输出选择规则。在强化学习中奖励信号由用户为特定任务自定义的评分器提供。对于数据集中的每个提示词平台会采样多个候选答案通过评分器完成量化评分并执行策略梯度更新。使得模型向高分答案优化。这种“采样-评分-更新”的循环会在数据集上反复执行直到模型能够稳定输出符合评分器质量标准的结果。评分器可编码用户关注的任意指标准确性、风格、安全性等因此最终的微调模型会体现这些核心诉求且无需用户管理强化学习底层基础设施。强化学习意义对于效果和泛化能力要求较高的场景强化学习rl相对于pe\sft具有更高的上限。对于反馈机制明确的场景rl训练构建比数据收集更简单对于困难任务相比标注高质量的数据集强化学习需要的成本更低。使用时机1、 目标清晰的客观任务任务答案有明确的判断标准能制定精确的奖励计算方法2、 需要定向约束或引导输出的任务如果要限制模型输出某些特定的内容比如违规信息/无关表述或者引导模型往特定的风格方向输出就可以结合奖励模型启动基于奖励的微调3、追求输出多样化的任务强化学习的类型PPO典型大模型实现使用奖励与 Critic 的价值预测计算优势同时训练策略模型和 Critic。GRPO对同一问题生成一组回答利用组内奖励计算相对优势不单独训练 Critic。参考资料[1] Hugging Face TRLSFT Trainer[2] Hugging Face PEFTLoRA[3] Hugging Face TransformersTrainer[4] Hugging Face TRLDPO Trainer[5] DeepSeekMath
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

关于使用iTop-4412制作简易的PWM波形调节器 2026/9/30 10:59:22

关于使用iTop-4412制作简易的PWM波形调节器

文章目录一、先看整体思路二、环境与硬件2.1 软硬件环境2.2 用到的引脚与接口三、驱动一:LED 字符设备驱动四、驱动二:PWM 驱动(重点)4.1 寄存器与初始化4.2 频率怎么换算五、Qt 界面:480272 小屏怎么排六、Qt 逻辑&am…

阅读更多 →
WinHex定位文件第一扇区:NTFS/FAT32原理与数据恢复实战 2026/9/30 10:59:21

WinHex定位文件第一扇区:NTFS/FAT32原理与数据恢复实战

简介:这是一份讲解如何使用WinHex定位磁盘文件首扇区位置的实操型演示文稿,面向操作系统、数据恢复、系统调试与安全取证方向的IT工程师及计算机专业学生。内容沿MBR、DBR、FAT表、根目录、目录项的完整链路展开:从零号扇区读取主引导记录与分…

阅读更多 →
从固态电池“十五五”规划看事件驱动训练:把政策信号拆成可验证条件 2026/9/30 10:59:21

从固态电池“十五五”规划看事件驱动训练:把政策信号拆成可验证条件

七部门联合印发新型电池产业发展“十五五”规划,固态电池发展受到关注。消息出来以后,相关讨论很快升温。对技术社区而言,这类产业事件除了本身的技术路线,还提供了一个值得拆解的问题:当政策信号进入市场,…

阅读更多 →
Nerd Fonts 中的 Droid Sans Mono:补丁字体变体选择、安装与自行打补丁实战指南 2026/9/30 10:59:20

Nerd Fonts 中的 Droid Sans Mono:补丁字体变体选择、安装与自行打补丁实战指南

开发工具CLI 【免费下载链接】nerd-fonts Iconic font aggregator, collection, & patcher. 3,600 icons, 50 patched fonts: Hack, Source Code Pro, more. Glyph collections: Font Awesome, Material Design Icons, Octicons, & more 项目地址: https://…

阅读更多 →
Redis主从复制原理与生产实战:从同步机制到故障排查 2026/9/30 10:59:19

Redis主从复制原理与生产实战:从同步机制到故障排查

从「Redis主从复制」这个词展开,我第一反应不是背诵那套面试八股,而是这些年踩过的坑:比如从节点数据延迟导致线上读到旧数据,比如没配好masterauth导致复制握手失败,再比如repl_backlog太小导致从节点断线重连后被迫全…

阅读更多 →
NFS、SMB、FTP、MinIO四大文件共享方案对比与选型指南 2026/9/30 10:59:12

NFS、SMB、FTP、MinIO四大文件共享方案对比与选型指南

做文件共享的人,十有八九都纠结过这个问题:NFS、SMB、FTP、MinIO到底该选哪个?我自己从最早在Linux服务器之间共享目录,到后来给公司搭NAS、做打印机扫描对接,再到用MinIO给应用做对象存储,这四个方案可以说…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉