新闻详情

新闻详情

首页 / 资讯中心 / 详情

如何微调DeepSeek-R1?cgft-llm训练数据构造与单机多卡并行加速深度实战

发布时间:2026/10/2 12:59:02来源:尧图网络
如何微调DeepSeek-R1?cgft-llm训练数据构造与单机多卡并行加速深度实战
如何微调DeepSeek-R1cgft-llm训练数据构造与单机多卡并行加速深度实战【免费下载链接】cgft-llmcgft-llm 是一个学习大语言模型LLM开发的开源资源。它提供代码、文档和视频教程帮助用户通过实践掌握前沿核心 LLM 技术项目地址: https://gitcode.com/echonoshy/cgft-llm本文将带你用开源项目cgft-llm完成一次完整的DeepSeek-R1 大模型微调实战从LLaMA-Factory 微调环境搭建、训练数据构造Alpaca/ShareGPT 格式与数据集注册到单机多卡并行加速训练命令与关键参数调优全程图文拆解适合刚入门 LLM 微调的新手快速上手。 本文对应的原始实战笔记deepseek-r1-finetune.md完整数据集整理指南见 llama-factory-training-dataset.md。一、为什么用 LLaMA-Factory 微调 DeepSeek-R1微调 DeepSeek-R1 蒸馏模型如 DeepSeek-R1-Distill-Qwen-7B社区常见两条路线方案特点是否推荐Unsloth速度快但对新版 R1 系模板/数据格式兼容性偶有问题⚠️ 谨慎使用LLaMA-Factory生态成熟、模板全含deepseek3模板、Web UI 命令行双模式✅ 推荐cgft-llm 的选择是LLaMA-Factory LoRA只用少量可训练参数lora_rank: 8就能显著改善模型在垂直领域的表现7B 模型在消费级显卡上也能跑起来。先克隆项目获取全部数据与配置git clone https://gitcode.com/echonoshy/cgft-llm二、环境准备一张 24G 显存的卡起步微调 7B 级 R1 蒸馏模型硬件门槛并不高GPU单张 RTX 409024GB即可 LoRA 训练多卡可进一步加速软件栈Python 3.10 / PyTorch 2.x / CUDA 12.x框架克隆 LLaMA-Factory 后执行pip install -e .[torch,metrics]即可安装时建议先配置模型下载镜像避免网络问题pip install huggingface_hub export HF_ENDPOINThttps://hf-mirror.com随后用huggingface-cli download分别下载SFT 蒸馏数据集11 万条中文对话与DeepSeek-R1-Distill-Qwen-7B基座模型放入训练目录即可。三、DeepSeek-R1 训练数据构造格式与数据集注册 微调效果的一半取决于数据。LLaMA-Factory 支持两种主流格式Alpaca 格式单轮指令instructioninput→output可带system与多轮historyShareGPT 格式多轮对话messages列表由role/content组成训练 function calling 能力时必须用它项目内置的 fintech.json 就是一个标准 Alpaca 样例第一条数据形如{ instruction: 国际经济与贸易专业的就业前景是怎么样的, input: , output: 国际经济与贸易专业的就业面较为广阔……, history: [[从事国际经济与贸易专业的人可以有哪些工作机会, ……]] } 数据处理三原则人工复核剔除脏数据不要全信 GPT 自动整理、内容做简化、按需数据增广详见 llama-factory-training-dataset.md。注册数据集dataset_info.json 一键配置新数据放进 LLaMA-Factory 的data/目录后只需在注册文件里加一段映射项目示例dataset_info.jsondistill_r1_110k: { file_name: your_sft_data.json, columns: { prompt: instruction, query: input, response: output, history: history } }训练时用--dataset distill_r1_110k引用即可模板务必指定--template deepseek3这是 R1 系列微调最容易踩的坑。微调后的 DeepSeek-R1 还能无缝接入 RAG 知识库你的文档数据经索引后与提示词一起送入 LLM 生成回答四、单机多卡并行加速3 张卡跑通 DDP 训练 单机多卡的核心思路指定可用 GPU → 框架自动启用 DDPDistributed Data Parallel→ 每张卡各持一份模型与参数梯度同步更新。CUDA_VISIBLE_DEVICES0,1,3 llamafactory-cli train \ --stage sft \ --model_name_or_path ./DeepSeek-R1-Distill-Qwen-7B \ --finetuning_type lora \ --template deepseek3 \ --dataset distill_r1_110k \ --cutoff_len 2000 \ --bf16 True \ --ddp_timeout 180000000多卡加速的 4 个关键点CUDA_VISIBLE_DEVICES0,1,3只挑空闲卡参与训练坏卡/占用卡直接跳过bf16 True混合精度显存与速度双优化--ddp_timeout 180000000数据预处理阶段耗时较长调大 DDP 超时避免多卡死等报错flash_attn autogradient_accumulation_steps 8注意力加速 梯度累积等效放大 batch 而不爆显存完整的训练命令含学习率5e-05、cosine调度器、lora_target all等全部参数已收录在 deepseek-r1-finetune.md可直接复制复现类似的 LoRA SFT 配置示例还有 train_llama3_lora_sft.yaml 可对照参考。关键训练参数速查表参数示例值作用learning_rate5e-05LoRA 常用 1e-5 ~ 5e-5过大易发散per_device_train_batch_size1单卡 batch显存吃紧就调小gradient_accumulation_steps8与上项相乘 等效 batchcutoff_len2000R1 回答偏长别设太小被截断num_train_epochs1.011 万级数据先跑 1 轮看 losslora_rank / lora_alpha8 / 16alpha 常取 rank 的 2 倍save_steps / logging_steps100 / 5便于保存中间 checkpoint、观察 loss 曲线五、训练完成之后LoRA 合并与验证 ✅训练结束后output_dir下会产出 LoRA 适配器与trainer_log.jsonl损失曲线--plot_loss True自动绘图。合并权重把基座与 LoRA 合并为完整模型配置参考 merge_llama3_lora_sft.yaml。⚠️ 注意不要用量化模型或quantization_bit参数来合并 LoRA对话验证llamafactory-cli webchat打开 Web 界面直接对话或llamafactory-cli chat走终端API 部署llamafactory-cli api提供 OpenAI 风格接口即可接入下游应用微调不止于对话配合 ShareGPT 格式数据同一套流程还能训练出会自主决定调用工具的 R1 模型六、新手避坑清单 坑解法模型输出格式乱--template与基座不匹配R1 系请用deepseek3多卡训练中途报错超时调大--ddp_timeout显存 OOM降per_device_train_batch_size用梯度累积补等效 batch回答被截断调大cutoff_lenR1 推理链较长效果不佳先查数据质量脏数据、格式错误都会拖垮 loss总结借助 cgft-llm 的完整素材你只需要三步就能完成一次生产级的DeepSeek-R1 微调备数据整理 Alpaca/ShareGPT 格式 SFT 数据并在dataset_info.json注册配环境LLaMA-Factory LoRA deepseek3模板跑多卡CUDA_VISIBLE_DEVICES指定空闲卡DDP 自动加速掌握这套流程后替换数据与基座模型即可批量微调出属于你自己的垂直领域大模型。更多 LLM 部署与 RAG 实战可继续阅读项目内 llama-factory/README.md 中的完整教程。【免费下载链接】cgft-llmcgft-llm 是一个学习大语言模型LLM开发的开源资源。它提供代码、文档和视频教程帮助用户通过实践掌握前沿核心 LLM 技术项目地址: https://gitcode.com/echonoshy/cgft-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

CSS文本属性与列表样式实战:从排版细节到列表标记的完整配置指南 2026/10/2 14:35:55

CSS文本属性与列表样式实战:从排版细节到列表标记的完整配置指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Kibana本质是Elasticsearch的DSL交互界面 2026/10/2 14:35:49

Kibana本质是Elasticsearch的DSL交互界面

1. 为什么Kibana不是“另一个图表工具”,而是日志分析系统的神经中枢很多人第一次接触Kibana,是在公司运维同事甩过来的一条链接里:“看下这个报错趋势”。点开后,满屏的折线图、饼图、柱状图,配着深色背景和几个搜索框…

阅读更多 →
一切皆是映射:从函数、状态机到流处理的统一思维框架 2026/10/2 14:35:49

一切皆是映射:从函数、状态机到流处理的统一思维框架

一篇博文的价值,不在于塞了多少新鲜名词,而在于它能不能帮你把脑子里那些原本乱成一团的念头,重新摆到正确的位置上。我最近一直在打磨一套自己的认知框架,名字暂时叫 FreeManus,核心就一句话:一切皆是映射…

阅读更多 →
RAG重排序实战:Reranker与MMR去冗余流水线 2026/10/2 14:35:49

RAG重排序实战:Reranker与MMR去冗余流水线

1. 为什么召回之后还需要一道"重排序"工序 做过RAG(检索增强生成)的人大多经历过这样一个阶段:把向量库搭起来,把文档切好灌进去,用户提问时top-k一取,直接丢给大模型,然后发现回答质…

阅读更多 →
Python爬虫+Flask+ECharts:小说数据分析可视化平台搭建实践 2026/10/2 14:35:49

Python爬虫+Flask+ECharts:小说数据分析可视化平台搭建实践

年初做“起点小说数据分析与可视化平台”的时候,我的出发点很朴素:当时自己书单越攒越多,但每本新品从简介、成绩到口碑都得靠手动翻榜单,来回切换效率太低。干脆用Python抓一遍起点中文网的公开榜单和书籍详情,存进数…

阅读更多 →
RAG精排实战:Reranker与MMR去冗余优化指南 2026/10/2 14:35:49

RAG精排实战:Reranker与MMR去冗余优化指南

1. 检索链路里最容易被低估的一环 做企业级智能问答系统,很多人把精力全砸在向量库选型和嵌入模型微调上,觉得只要召回够快够多,答案质量自然就上去了。我最早也这么想,直到在一个内部知识库项目里踩了坑:用户问“报销…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉