新闻详情

新闻详情

首页 / 资讯中心 / 详情

RL-赵-(八)-ValueBased04-ActionValue估算:Deep Q-learning01(DQN)【目标:最优化网络参数⮕使得通过网络计算出的q是最优的】

发布时间:2026/9/26 9:59:52来源:尧图网络
RL-赵-(八)-ValueBased04-ActionValue估算:Deep Q-learning01(DQN)【目标:最优化网络参数⮕使得通过网络计算出的q是最优的】
RL-赵-(八)-Value-Based04:Deep Q-learning【两网络:固定T,更新M,定期将M的参数赋给T】【经验池】【目标:最优化网络参数->使得通过网络计算出的q是最优的】Deep Q-learning算法又被称为deep Q-network (DQN):最早的一个和最成功的一个将深度神经网络算法引入到强化学习中;神经网络的角色从本质上来说就是一个非线性函数approximator;与下面的算法不同,是由于训练一个网络的方式;这个算法是最早的也是最成功的一个把深度神经网络引入到强化学习的一个算法。当然它不是最早的一个,因为在它之前已经有人把神经网络引入到强化学习当中,但是并不是那么成功。Deep Q-learning取得成功主要是在应用和方法这两个点上:在应用上它取得了非常好的效果,就是在一系列的游戏的控制上已经达到了人类控制的水平;然后在方法上它也使用了一些关键的技术,那这些技术在后边很多方法当中也被广泛地使用;在我们介绍Deep Q-learning之前我想先澄清一个问题,什么问题呢?有的同学可能会说刚才我们不是已经介绍了Q-learning with function approximation吗? 那我为什么不能直接用Q-learning with function approximation这个算法呢?为什么还需要再去介绍一个Deep Q-learning呢?就是因为如下图的神经网络,参数是www,输入是sss和aaa,,然后输出是q^\hat{q}q^​。其实我们用这个式子也是可以的这时候我需要对神经网络这个“值函数”进行非常底层的运算,我要计算出来它的梯度然后我要去直接赋值,然后对它的参数进行更新迭代。但是现在神经网络的工具包已经非常的成熟了,对我们很多人而言它就是一个黑盒,把数据给送进去它能够选择非常合适的参数和非常底层的算法去做很好的训练。所以从这个角度来说,我们不再会用这种这么底层的方法来人工计算迭代,而是会用我们接下来所介绍的Deep Q-learning的方法。我要训练神经网络我就需要一个,loss function或者我们叫objective function。一、Deep Q-learning损失函数Deep Q-learning旨在最小化目标函数/损失函数:J(w)=E[(R+γmax⁡a∈A(S′)q^(S′,a,w)−q^(S,A,w))2]\begin{aligned} J(w)=\mathbb{E}\left[\left(R+\gamma\max_{a\in\mathcal{A}(S')}\hat{q}(S',a,w)-\hat{q}(S,A,w)\right)^2\right] \end{aligned}J(w)=E[(R+γa∈A(S′)max​q^​(S′,a,w)−q^​(S,A,w))2]​其中(S,A,R,S′)(S,A,R,S^{\prime})(S,A,R,S′)是随机变量。Deep Q-learning的损失函数实际上就是:Bellman optimality error,因为:q(s,a)=E[Rt+1+γmax⁡a∈A(St+1)q(St+1,a)∣St=s,At=a],∀s,aq(s,a)=\mathbb{E}\left[\left.R_{t+1}+\gamma\max_{a\in\mathcal{A}(S_{t+1})}q(S_{t+1},a)\right|S_t=s,A_t=a\right],\quad\forall s,aq(s,a)=E
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

为什么 Github Copilot 要收集你的数据?聊聊 AI 订阅便宜背后的数据标注逻辑与 TaoToken 配置 2026/9/26 10:51:21

为什么 Github Copilot 要收集你的数据?聊聊 AI 订阅便宜背后的数据标注逻辑与 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
【OpenAI】# GPT-4.5 模型详解:自然对话与情感智能的升级之作,附 TaoToken 统一 API 通道配置教程 2026/9/26 10:51:21

【OpenAI】# GPT-4.5 模型详解:自然对话与情感智能的升级之作,附 TaoToken 统一 API 通道配置教程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Claude Code 最佳实践:Superpowers 开源项目 198k Star 的配置骨架与验证动作 2026/9/26 10:51:21

Claude Code 最佳实践:Superpowers 开源项目 198k Star 的配置骨架与验证动作

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Claude Code 深度拆解:从 CLI 到 Agent,它凭什么被称为「最接近真实工程师」的 AI 编码工具 2026/9/26 10:51:21

Claude Code 深度拆解:从 CLI 到 Agent,它凭什么被称为「最接近真实工程师」的 AI 编码工具

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
【Bug已解决】Codex CLI Docker 容器内报错 exec: “codex“: executable file not found in $PATH 解决方案:TaoToken 统一 Ke 2026/9/26 10:51:21

【Bug已解决】Codex CLI Docker 容器内报错 exec: “codex“: executable file not found in $PATH 解决方案:TaoToken 统一 Ke

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Prompts 到 Skills:用 TaoToken 统一 Key 打通 AI 辅助 SAP 开发的演进之路 2026/9/26 10:51:15

Prompts 到 Skills:用 TaoToken 统一 Key 打通 AI 辅助 SAP 开发的演进之路

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉