新闻详情

新闻详情

首页 / 资讯中心 / 详情

RL-赵-(九)-Policy函数拟合算法-Policy Gradient算法03:REINFORCE算法【梯度提升法更新π参数θ时通过MC算法计算qₜ(sₜ,aₜ)来近似q_π(sₜ,aₜ)】

发布时间:2026/9/27 23:33:32来源:尧图网络
RL-赵-(九)-Policy函数拟合算法-Policy Gradient算法03:REINFORCE算法【梯度提升法更新π参数θ时通过MC算法计算qₜ(sₜ,aₜ)来近似q_π(sₜ,aₜ)】
RL-赵-(九)-Policy-Based03:REINFORCE算法【在线】【第一个Policy Gradient算法】【梯度上升法更新π的参数θ时通过“MC采样”估计的方法计算q_t来近似q_π】现在,给出第一个Policy Gradient Algorithm以发现最优策略。从上一节,我们已经知道梯度的表达式为:∇ θ J ( θ ) = E [ ∇ θ ln ⁡ π ( A ∣ S , θ t ) q π ( S , A ) ] \nabla_\theta J(\theta) = \mathbb{E}\left[\nabla_\theta\ln\pi(A|S,\theta_t)q_\pi(S,A)\right]∇θ​J(θ)=E[∇θ​lnπ(A∣S,θt​)qπ​(S,A)]所以,用于最大化J ( θ ) J(\theta)J(θ)的Gradient-Ascent算法是:θ t + 1 = θ t + α ∇ θ J ( θ ) = θ t + α E [ ∇ θ ln ⁡ π ( A ∣ S , θ t ) q π ( S , A ) ] \begin{aligned} \theta_{t+1} \begin{aligned}=\theta_t+\alpha\nabla_\theta J(\theta)\end{aligned} \\ =\theta_t+\alpha\mathbb{E}\left[\nabla_\theta\ln\pi(A|S,\theta_t)q_\pi(S,A)\right] \end{aligned}θt+1​​=θt​+α∇θ​J(θ)​=θt​+αE[∇θ​lnπ(A∣S,θt​)qπ​(S,A)]​这个在实际当中是不能用的 为什么呢?因为这有一个expectation。这里面就涉及到了状态它的分布,如果我们知道所有的信息的话,其实这个分布我们是能确定下来的,但是很可惜,比如说环境的模型等等我们都是不知道的,那这时候我们是无法计算这个expectation的。所以我们要用随机(Stochastic )的梯度来代替这个真实的梯度,那这样的话我就得到这样一个式子:θ t + 1 = θ t + α ∇ θ ln ⁡ π ( a t ∣ s t , θ t ) q π ( s t , a t ) \theta_{t+1}=\theta_t+\alpha\nabla_\theta\ln\pi(a_t|s_t,\theta_t)\color{red}{q_\pi(s_t,a_t)}θt+1​=θt​+α∇θ​lnπ(at​∣st​,θt​)qπ​(st​,at​)实际上,这个式子其实也是不能用的 为什么呢?因为这里面有一个q π q_πqπ​(是策略π ππ所对应的真实的action value),那怎么办呢?进一步地,因为q π q_\mathrm{\pi}qπ​是不知道的,所以用一个方法来近似或对q π q_\mathrm{\pi}qπ​进行采样,把q π q_\piqπ​换成q t q_tqt​​θ t + 1 = θ t + α ∇ θ ln ⁡ π ( a t ∣ s t , θ t ) q t ( s t , a t ) \theta_{t+1}=\theta_t+\alpha\nabla_\theta\ln\pi(a_t|s_t,\theta_t)\color{red}{q_t(s_t,a_t)}θt+1​=θt​+α∇θ​lnπ(at​∣st​,θt​)qt​(st​,at​)这里有不同的方法去近似q π ( s t , a t ) q_\pi(s_t,a_t)qπ​(st​,at​):第一种方法:基于Monte-Carlo方法: REINFORCE;【这也是最直观的,要估计q π ( s t , a t ) q_\pi(s_t,a_t)qπ​(st​,at​)那我就从( s , a ) (s,a)(s,a)出发我得到一个episode,然后我计算这个episode的return假如说是g gg,那这个g gg实际上就是这个q t ( s , a ) q_t(s,a)qt​(s,a),我就用这个q t ( s , a ) q_t(s,a)qt​(s,a)来近似q π ( s t , a t ) q_\pi(s_t,a_t)qπ​(st​,at​)。基于这个Monte-Carlo方法和policy gradient的算法相结合,得到的这样一个算法有一个名字叫做REINFORCE。】其他方法:基于TD方法等,这就引出了Actor-Critic方法;补充几个非常重要的说明:1、如何采样?E S ∼ d , A ∼ π [ ∇ θ ln ⁡ π ( A ∣ S , θ t ) q π ( S , A ) ] ⟶ ∇ θ ln ⁡ π ( a ∣ s , θ t ) q π ( s , a ) \mathbb{E}_{\color{red}{S}\sim d,\color{red}{A}\sim\pi}\left[\nabla_\theta\ln\pi(A|S,\theta_t)q_\pi(S,A)\right]\longrightarrow\nabla_\theta\ln\pi(a|s,\theta_t)q_\pi(s,a)ES∼d,A∼π​[∇θ​lnπ(A∣S,θt​)qπ​(S,A)]⟶∇θ​lnπ(a∣s,θt​)qπ​(s,a)如何采样S SS呢?S ∼ d S\sim dS∼d,对于S来说它服从的分布是一个d dd,其中 the distributiond dd是一个基于π \piπ的 long-run behavior(它代表了一种长期,就是我跑了很久之后所得到的一种对S的分布。但是在实际当中我们一般来说都不这么做,因为我们有数据就不错了,我们不会说要采很久之后等它达到那种平稳的状态然后再去用这个数据,所以这个我们在实际当中一般是不太考虑S ∼ d S\sim dS∼
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

如何免费开个人网站:3步搞定源码下载,告别丑模板 2026/9/28 0:26:18

如何免费开个人网站:3步搞定源码下载,告别丑模板

如何免费开个人网站:3步搞定源码下载,告别丑模板 别再被那些千篇一律、配色刺眼的模板网站折磨了。说实话,看着自己精心准备的文案被塞进一个满是“Lorem…

阅读更多 →
2026最新卖建材的网站有哪些?被黑挂马别慌,附实战自查指南 2026/9/28 0:26:11

2026最新卖建材的网站有哪些?被黑挂马别慌,附实战自查指南

2026最新卖建材的网站有哪些?被黑挂马别慌,附实战自查指南 上周刚帮一个做混凝土外加剂的老板救急。他那站突然跳出博彩广告,后台密码全改,吓得他以为号丢了。其实这就是典型的网站被黑挂马。很多建材老板不懂技术,一旦中招,要么重装系统丢数据,要…

阅读更多 →
如何建设自己网站?避开这3个致命漏洞,建站报价省一半 2026/9/28 0:25:52

如何建设自己网站?避开这3个致命漏洞,建站报价省一半

如何建设自己网站?避开这3个致命漏洞,建站报价省一半 网站做好了没人访问,往往不是内容不够好,而是后台被黑了,或者加载慢到用户直接关页面。很多新手在咨询 建站报价…

阅读更多 →
南宁网站建设公司利润真相:新手怎么选避坑指南 2026/9/28 0:25:20

南宁网站建设公司利润真相:新手怎么选避坑指南

南宁网站建设公司利润真相:新手怎么选避坑指南 网站上线三个月,后台日志显示每天只有寥寥几个IP访问,全是蜘蛛或者自己点的。这种“网站做好了没人访问”的绝望感,是无数南宁老板和初创企业最真实的痛点。你花了几万甚至十几万做的站,成了公司官网里的…

阅读更多 →
新手入门外贸网站服务器推荐:3个坑避开,省钱又稳定 2026/9/28 0:25:14

新手入门外贸网站服务器推荐:3个坑避开,省钱又稳定

新手入门外贸网站服务器推荐:3个坑避开,省钱又稳定 域名解析报错?服务器连不上?对于刚接触外贸建站的新手来说,“域名服务器搞不懂”是比代码还劝退的第一道坎。很多人以为买个好域名就行,结果部署时才发现,选错服务器比选错颜色更致命。…

阅读更多 →
WordPress页面模板目录文件下载:5大注意事项避坑指南 2026/9/28 0:25:13

WordPress页面模板目录文件下载:5大注意事项避坑指南

WordPress页面模板目录文件下载:5大注意事项避坑指南 域名解析报错?服务器连不上?别慌,这往往是新手搞混了本地环境与线上部署的边界。很多做网站的朋友,一上来就对着浏览器地址栏发呆,觉得“我明明下载了文件,为什么打不开?”其实,…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉