新闻详情

新闻详情

首页 / 资讯中心 / 详情

RL-赵-(七)-不基于模型2-时序差分/TD算法05-计算ActionValue:Q-Learning01【求贝尔曼最优公式⮕直接得最优ActionValue⮕直接更新目标π】【无需PE与PI迭代】

发布时间:2026/9/25 2:11:05来源:尧图网络
RL-赵-(七)-不基于模型2-时序差分/TD算法05-计算ActionValue:Q-Learning01【求贝尔曼最优公式⮕直接得最优ActionValue⮕直接更新目标π】【无需PE与PI迭代】
RL-赵-(七)-不基于模型5:Q-Learning【TD算法】【离线】【基于RM算法在无模型条件下求解贝尔曼最优公式->直接计算出最优ActionValue->直接更新目标π】【无需PE与PI迭代】直接求解q*(最优action value)得到最优策略,无需在PE与PI迭代来找最优策略。直接估计optimal action values,不需要进行policy evaluation和policy improvement相互迭代计算来找最优策略。接下来,我们介绍Q-learning,这是最广泛使用的强化学习算法之一。Sarsa基于一个给定的policy估计action value,它必须整合policy improvement step才能寻找最优策略。Q-learning直接估计optimal action values,从而找到最优策略。TD算法【用来计算State Valuevvv】:vt+1(st)⏟newestimate=vt(st)⏟currentestimate−αt(st)[vt(st)−[rt+1+γvt(st+1)⏟υˉtTDtargetvˉt]]⏞TDerrorδt\color{red}{ \underbrace{v_{t+1}(s_t)}_{\text{new estimate}} =\underbrace{v_t(s_t)}_{\text{current estimate}} - \alpha_t(s_t)[\overbrace{v_t(s_t)-[\underbrace{r_{t+1}+\gamma v_t(s_{t+1})}_{\bar{\upsilon}_t}^{\text{TD target }\bar{v}_t}]]}^{\text{TD error}\ \delta_t}}newestimatevt+1​(st​)​​=currentestimatevt​(st​)​​−αt​(st​)[vt​(st​)−[TDtargetvˉt​rt+1​+γvt​(s
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

什么是递归自我改进(RSI)?NeoHorse-1-4B 如何搭建「自我进化」Agent 原型 2026/9/25 2:52:55

什么是递归自我改进(RSI)?NeoHorse-1-4B 如何搭建「自我进化」Agent 原型

什么是递归自我改进(RSI)?NeoHorse-1-4B 如何搭建「自我进化」Agent 原型 【免费下载链接】NeoHorse-1-4B 项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B NeoHorse-1-4B 是一个约 4B 参数的因果语言模型&a…

阅读更多 →
3 条命令跑通抖音无水印批量下载:douyin-downloader 从安装到调优实操 2026/9/25 2:52:55

3 条命令跑通抖音无水印批量下载:douyin-downloader 从安装到调优实操

3 条命令跑通抖音无水印批量下载:douyin-downloader 从安装到调优实操 【免费下载链接】douyin-downloader A practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, SQLite deduplication, and browser…

阅读更多 →
Nunjucks FAQ 深度解读:Node 与浏览器双端使用、Jinja2 模板兼容性全解析 2026/9/25 2:52:55

Nunjucks FAQ 深度解读:Node 与浏览器双端使用、Jinja2 模板兼容性全解析

模板引擎 【免费下载链接】nunjucks A powerful templating engine with inheritance, asynchronous control, and more (jinja2 inspired) 项目地址: https://gitcode.com/gh_mirrors/nu/nunjucks 点击查看 免费下载 本文基于 Nunjucks 官方中文 FAQ,围…

阅读更多 →
网络安全入门学习路线:从零基础到渗透测试实战 2026/9/25 2:52:49

网络安全入门学习路线:从零基础到渗透测试实战

1. 先给“黑客”祛魅:这个行当到底在做什么经常有人私信问我同一个问题:“我想学黑客,能不能教我怎么黑别人的网站?”说实话,我第一次接触网络安全的时候,也是带着这种好奇入坑的。但等你真正进了这个圈子&…

阅读更多 →
C#实现欧姆龙PLC FINS通信:绕过地址偏移、字节序与帧头校验 2026/9/25 2:52:37

C#实现欧姆龙PLC FINS通信:绕过地址偏移、字节序与帧头校验

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
HHO-LSBoost多输入回归预测:哈里斯鹰优化与Matlab实现 2026/9/25 2:52:37

HHO-LSBoost多输入回归预测:哈里斯鹰优化与Matlab实现

做预测建模这些年,我最深刻的体会就是:调参的功夫往往比跑模型本身还多。尤其是用集成学习做回归预测时,弱学习器的数量、学习率、树深这些超参数,直接决定了模型的上限,可手动一个个试又费时又费力。所以当我尝试把哈…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉