新闻详情

新闻详情

首页 / 资讯中心 / 详情

system-design-101 详解:ChatGPT 是如何工作的——从预训练、微调到内容审核的完整链路

发布时间:2026/10/2 1:41:07来源:尧图网络
system-design-101 详解:ChatGPT 是如何工作的——从预训练、微调到内容审核的完整链路
后端文档教程【免费下载链接】system-design-101Explain complex systems using visuals and simple terms. Help you prepare for system design interviews.项目地址https://gitcode.com/GitHub_Trending/sy/system-design-101点击查看免费下载本指南基于 system-design-101 仓库的 ChatGPT 工作原理 一文展开用可视化与简单术语拆解 ChatGPT 的完整运行机制。读完本文你将掌握 ChatGPT 从「互联网语料预训练」到「人类反馈微调」再到「线上问答全流程」的两阶段训练管线与七步推理链路并能从系统设计的角度理解内容审核、模板响应等安全组件为何必不可少。说明OpenAI 并未公开全部实现细节仓库原文也指出「diagram 中部分细节可能不完全准确」。因此本文基于仓库文档描述的原理框架进行展开涉及具体数字与内部实现的部分均以「推测 / 业界通用做法」表述而非未经证实的事实。总览ChatGPT 的工作可以拆成两大部分正如 原文档 所述ChatGPT 的完整工作流程可以拆分为两个部分训练Training把一个大语言模型从「会补全句子」训练成「会回答问题」的对话助手推理Answer a Prompt用户输入问题后模型结合内容审核组件安全地生成回答。这两个部分分别对应了机器学习的「模型构建期」与「服务运行期」也是系统设计面试中常被考察的 AI 应用分层。下文先讲训练再讲推理。第一部分训练——两个阶段把补全器变成问答助手训练 ChatGPT 模型需要经历两个阶段预训练Pre-training与微调Fine-tuning。阶段一预训练——在互联网语料上学会「续写」在预训练阶段我们训练一个GPT 模型decoder-only transformer仅解码器 Transformer输入是海量的互联网文本数据。训练目标是让模型学会给定一个句子预测接下来最可能出现的词并且预测结果在语法正确性和语义合理性上都接近互联网数据本身的分布。模型架构decoder-only transformer。Transformer 架构源自 2017 年论文《Attention Is All You Need》通过自注意力机制与并行化大幅缩短训练时间是生成式 AI 的基础这一点在仓库的 ChatGPT 时间线 中也有对应描述。训练目标自回归式的「下一个词预测next-token prediction」。模型每次只看到前文预测下一个 token再与真实的下一个 token 计算交叉熵损失并反向传播更新参数。阶段产物经过预训练后模型已经具备很强的续写能力——给定任意半句话它能补出语法通顺、语义合理的后续内容。但它还不能回答问题你问它一个问题它只会顺着问题「接着写」而不是给你一个答案。这是预训练与微调之间最关键的能力鸿沟预训练解决「懂语言」微调解决「懂对话」。阶段二微调——三步把模型变成问答助手微调阶段是一个 3 步流程对应 OpenAI 在 InstructGPT 论文中提出的 InstructGPT 路线把预训练模型改造成能回答问题的 ChatGPT 模型第 1 步收集「问题-答案」数据做监督微调SFT收集大量问题答案训练数据用这些数据对预训练模型做监督式微调。模型以问题为输入学习生成与训练数据中答案相似的回答。这一步的本质是模仿学习让模型学会「面对提问时应该输出答案而不是继续追问」。第 2 步训练奖励模型Reward Model来给回答打分收集更多数据对同一个问题收集多个候选答案并由人工或规则将这些答案从最相关到最不相关排序。用这些排序数据训练一个奖励模型reward model让它学会预测「哪个回答更好」。奖励模型不是生成器而是一个打分器——它给任意「问题 回答」组合输出一个标量分数分数越高表示回答质量越高。第 3 步用强化学习PPO优化模型回答的准确性使用强化学习具体算法为PPOProximal Policy Optimization近端策略优化继续微调模型。流程是让策略模型针对某个问题生成回答 → 奖励模型对这个回答打分 → 用 PPO 更新策略模型参数使模型学会生成更容易获得高分的回答。反复迭代后模型的回答在相关性、准确性、符合人类偏好等方面持续提升。这 3 步组合起来就是业界常说的RLHFReinforcement Learning from Human Feedback基于人类反馈的强化学习的标准配方SFT 对齐对话形式奖励模型对齐人类偏好PPO 把偏好固化成策略。训练阶段的仓库佐证这一路线在开源生态中的位置仓库中 DeepSeek 一页纸 对这条技术路线的变体做了很好的注脚多数 AI 模型采用监督微调模仿大量人工标注示例但这种方式有局限DeepSeek R1 改用 GRPOGroup Relative Policy Optimization这类强化学习技术通过在同一上下文内比较多个候选答案来提升推理效率。这说明「预训练 → 微调 → 强化学习」是当前大模型训练的主流范式而具体算法仍在快速演进。如果你想搭建自己的对话模型仓库的 开源 AI 技术栈 一文列出了从模型访问Ollama、HuggingFace、后端框架FastAPI、Langchain到向量检索Milvus、FAISS、PGVector的完整开源工具链可以直接对照这条训练管线落地。第二部分推理——用户提问后的完整链路训练完成后模型进入线上服务。仓库原文把「回答一个 prompt」拆成了 7 个步骤核心特征是内容审核组件贯穿输入与输出两侧完整 7 步流程Step 1用户输入完整问题用户输入完整问题例如「Explain how a classification algorithm works」解释分类算法是如何工作的。这个例子特意选了一个「问法完整、语义清晰」的问题便于模型理解意图。Step 2问题先经过内容审核组件问题首先被发送到内容审核content moderation组件。该组件确保输入问题不违反安全准则并过滤掉不当问题如违法、暴力、仇恨言论、隐私侵犯等。Step 3-4按审核结果分流如果输入通过了内容审核问题被发送到ChatGPT 模型进入正常的模型推理如果输入未通过内容审核则直接进入模板响应生成template response generation即返回一条预设的安全模板回答例如「抱歉我无法回答这个问题」不再调用模型。Step 5-6模型输出再次经过内容审核模型生成回答后输出再次被发送到内容审核组件。这一次审核确保生成的回答是安全safe、无害harmless、无偏见unbiased的——即使问题本身合规模型也可能生成越界内容所以输出侧审核不可省略。Step 7按审核结果返回用户如果模型输出通过了内容审核回答被展示给用户如果未通过则走模板响应生成向用户展示一条预设的模板回答。双向审核的工程意义从系统设计角度看这个 7 步流程最值得注意的点是审核发生在两个方向输入审核Input Moderation成本低、拦截早。把明显违规的请求挡在模型推理之前既保护用户又节省 GPU 推理算力。输出审核Output Moderation防御「越狱 / 对抗性提示」导致的模型输出失控。因为恶意输入可能伪装成合规请求只有对输出再做一次独立检查才能保证最终呈现给用户的内容安全。推理阶段的仓库佐证从「生成」到「使用」的完整 AI 应用形态仓库的 什么是 AI Agent 一文展示了这条推理链路如何被进一步封装AI Agent 是能够感知环境、自主决策并调用工具访问互联网、代码解释器、API 调用完成目标的软件程序其信息处理与决策功能正是由一个 LLM 承担。也就是说「输入审核 → 模型生成 → 输出审核」这条 ChatGPT 推理链路是所有基于 LLM 的应用包括 AI Agent、RAG 问答系统的公共底座。常见误区与面试要点「ChatGPT 是搜索引擎」是误解它的推理链路里没有检索数据库答案完全由模型按概率生成。内容审核组件负责安全但不会「查资料」。预训练模型 ≠ 对话模型仅预训练的模型只会续写不会问答——这是区分「GPT 基础模型」与「ChatGPT 对话模型」的关键分界。微调不止一步SFT 奖励模型 PPO 三者缺一不可奖励模型解决「怎么算好」PPO 解决「怎么做到好」。审核是双向的只审核输入不审核输出无法防御模型自身的失控生成只审核输出不审核输入则浪费推理算力。算法仍在演进PPO 并非唯一选择仓库的 DeepSeek 一页纸 提到的 GRPO 等新方法正在改变微调阶段的成本与效果。相关阅读ChatGPT 时间线从 1950 年代规则模型、CNN/RNN/GAN 到 2017 年 Transformer 的演进脉络理解 ChatGPT 为何「突然」出现开源 AI 技术栈构建对话类 AI 应用的完整开源工具链选型什么是 AI AgentLLM 推理链路如何被封装为可自主行动的 AgentDeepSeek 一页纸监督微调局限性与 GRPO 强化学习新路线的对比。赞分享后端文档教程【免费下载链接】system-design-101Explain complex systems using visuals and simple terms. Help you prepare for system design interviews.项目地址https://gitcode.com/GitHub_Trending/sy/system-design-101点击查看免费下载相关推荐lllyasviel/Annotators模型训练从预训练到微调的完整指南lllyasviel/Annotators模型训练从预训练到微调的完整指南 引言为什么需要专业的模型训练指南 在计算机视觉和深度学习领域模型训练是一个复人工智能计算机视觉深度学习ERNIEKit工具链从预训练到微调的全流程开发ERNIEKit工具链从预训练到微调的全流程开发 ERNIEKit是百度基于PaddlePaddle框架开发的专业大模型训练工具链专门为ERNIE系列大模型大模型深度学习一条命令跑通CyberPII-BenchPII脱敏评估上手手册一条命令跑通CyberPII BenchPII脱敏评估上手手册 场景切入 如果你的 AI 智能体把客户邮箱、内网 IP 原样写进了给客户的渗透测试报告问题就人工智能AI Agent网络安全渗透测试工具调用AI 评测上一篇命令行AI工具LLM终极安装指南4种方法5分钟快速上手下一篇FlexGet高级技巧如何编写自定义插件扩展功能创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

2200张YOLO医疗健康数据集:用目标检测让疼痛可视化 2026/10/2 4:25:55

2200张YOLO医疗健康数据集:用目标检测让疼痛可视化

让“疼痛”可以被看见:2200张YOLO医疗健康数据集的构建与训练实战记录疼痛是临床上最常见的症状,也是患者就医的首要原因。但问题在于,它是极度主观的。医生问“有多痛”,患者只能给出“有点痛”“痛死了”这种模糊描述&#xff0…

阅读更多 →
Hutool时间工具DateUtil实战:Java日期处理的高效封装方案 2026/10/2 4:25:55

Hutool时间工具DateUtil实战:Java日期处理的高效封装方案

1. 为什么我三年来所有Java项目都默认引入Hutool的时间工具模块在Java开发日常里,时间处理从来不是“写个new Date()就能搞定”的事。它是一连串让人头皮发麻的连锁反应:时区错乱导致定时任务凌晨三点跑、格式化字符串拼错引发生产环境空指针、跨月计算少…

阅读更多 →
YOLO医疗数据集实战:2200张图片训练疼痛检测模型全流程 2026/10/2 4:25:55

YOLO医疗数据集实战:2200张图片训练疼痛检测模型全流程

如果你正在做AI医疗方向的目标检测,或者手里正好有个“疼痛检测”的需求,那“疼痛检测数据集 | 2200张YOLO医疗健康数据集”这种资源你应该不陌生。2200张的规模在医疗数据集里不算大,但配合YOLO的迁移学习能力,完全足够训练一个能…

阅读更多 →
用LLM重构AI学习操作系统:从Excel出发的实战路径 2026/10/2 4:25:54

用LLM重构AI学习操作系统:从Excel出发的实战路径

1. 这不是“用LLM学AI”,而是用LLM重构你的AI学习操作系统你搜过“LLM 人工智能 学习”——页面刷出来几百个标题:《30天速成AI工程师》《大模型入门指南》《零基础玩转LLM》,点开一看,要么是照搬论文摘要的术语堆砌,要…

阅读更多 →
企业级 Agent 从 Demo 到生产:工具调用、权限安全、上下文成本与评测可观测四道坎 2026/10/2 4:25:54

企业级 Agent 从 Demo 到生产:工具调用、权限安全、上下文成本与评测可观测四道坎

1. 为什么 Demo 惊艳、上线拉胯:企业 Agent 的真实落差做过企业 Agent 项目的人,大概率都经历过同一个剧本:会议室里 Demo 跑得行云流水,老板点头、业务方鼓掌,项目顺利立项;三个月后上线,用户骂…

阅读更多 →
未来五年课堂变革:数据驱动的混合式教学与教师能力升级 2026/10/2 4:25:47

未来五年课堂变革:数据驱动的混合式教学与教师能力升级

这几天在整理自己过去几年的教研笔记,翻到2021年刚开始尝试翻转课堂的记录,感触很深。那时教室里装的是老式投影,学生人手一台平板但不知道能拿来干什么,第一次用在线答题系统还因为无线网络问题翻了车。短短几年过去,…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉