新闻详情

新闻详情

首页 / 资讯中心 / 详情

RL-赵-(四)-基于模型01:值迭代算法(其中的值不是State Value,通过一步求出)【v₀(随机初始化)➞策略更新/PU➞π₁➞值更新/PE➞v₁➞PU➞π₂➞...】

发布时间:2026/9/25 6:14:44来源:尧图网络
RL-赵-(四)-基于模型01:值迭代算法(其中的值不是State Value,通过一步求出)【v₀(随机初始化)➞策略更新/PU➞π₁➞值更新/PE➞v₁➞PU➞π₂➞...】
一、值迭代算法(Value iteration algorithm)如下,如何求解贝尔曼最优公式(Bellman Optimality Equation)?v=f(v)=max⁡π(rπ+γPπv) \color{red}{v=f(v)=\max_{\pi}\left(r_\pi\right.+\gamma P_\pi v)}v=f(v)=πmax​(rπ​+γPπ​v)根据之前的内容,我们知道可以采用压缩映射定理(contraction mapping thcorerin)使用迭代算法求解:vk+1=f(vk)=max⁡π(rπ+γPπvk),k=1,2,3,... v_{k+1}=f(v_k)=\max_{\pi}(r_\pi+\gamma P_\pi v_k),k=1,2,3,...vk+1​=f(vk​)=πmax​(rπ​+γPπ​vk​),k=1,2,3,...其中初始值v0v_{0}v0​是一个任意值;该算法最终能够发现最优状态值 (optimal state value) 和一个最优策略 (optimal policy) ;该算法被称为值迭代算法(Value iteration);1、值迭代算法详细过程vk+1 = f(vk )=max⁡π(rπ + γPπvk ),k=1,2,3... v_{k+1}\:=\:f(v_k\:)=\max_{\pi}\left(r_\pi\:+\:\gamma P_\pi v_k\:\right),k=1,2,3...vk+1​=f(vk​)=πmax​(rπ​+γPπ​vk​),k=1,2,3...可以分解为两部:Step 1:Policy Update, 这一步是处理等号右侧的优化问题,求解πk+1\pi_{k+1}πk+1​:πk+1=argmax⁡π(rπ+γPπvk) \pi_{k+1}=arg\max_{\pi}\left(r_{\pi}\right.+\gamma P_{\pi}\left.v_{k}\right)πk+1​=argπmax​(rπ​+γPπ​vk​)其中vkv_kvk​是给定的Step 2:Value Updatevk+1=rπk+1+γPπk+1vk v_{k+1}=r_{\pi_{k+1}}+\gamma P_{\pi_{k+1}}v_kvk+1​=rπk+1​​+γPπk+1​​vk​问题:vkv_kvk​是不是一个state value? 当然不是。从上面公式可以看到,而等式左边是vk+1v_{k+1}vk+1​,等式右边是vkv_k
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

ESP32上WASM无法直接调用硬件的根本原因解析 2026/9/25 6:55:12

ESP32上WASM无法直接调用硬件的根本原因解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
【Python深度学习】Pytorch 一维张量常用方法 2026/9/25 6:55:11

【Python深度学习】Pytorch 一维张量常用方法

PyTorch 是一个基于 Python 的开源深度学习框架,以张量操作为核心,可以高效地构建、训练和部署深度学习模型。掌握一维张量的基本操作是理解 PyTorch 的基础,也是进阶学习的必要条件。 本文将介绍一维张量的类型、形状、索引和切片操作、常见函数方法、以及与 Numpy 和 Pan…

阅读更多 →
RoboCurve:用GPT-6 Astra大模型直接控制ROS2机器人的完整实践 2026/9/25 6:55:05

RoboCurve:用GPT-6 Astra大模型直接控制ROS2机器人的完整实践

1. 项目缘起与整体设计思路1.1 为什么想到让大模型直接控制机器人先说清楚这个项目到底在干什么。RoboCurve 的核心目标,是让 GPT-6 Astra 这类大语言模型通过 ROS2 的话题、服务、动作三种通信机制,直接对机器人下发控制指令,而不需要人再写…

阅读更多 →
【Python深度学习】Keras进行NLP词嵌入 2026/9/25 6:55:05

【Python深度学习】Keras进行NLP词嵌入

词嵌入(Word Embedding)是文本数据表示的核心技术之一,通过将单词表示为密集向量,将其映射到连续的向量空间中,帮助神经网络模型更好地理解文本语义。相较于传统的词袋模型,词嵌入更紧凑且富含信息,不仅能够捕捉单词间的语义关系,还为下游任务(如情感分类、文本生成等…

阅读更多 →
jc 解析器深入:使用 `jc --ini-dup` 保留 INI 重复键值的 JSON 转换指南 2026/9/25 6:54:58

jc 解析器深入:使用 `jc --ini-dup` 保留 INI 重复键值的 JSON 转换指南

开发工具 【免费下载链接】jc CLI tool and python library that converts the output of popular command-line tools, file-types, and common strings to JSON, YAML, or Dictionaries. This allows piping of output to tools like jq and simplifying automation scripts.…

阅读更多 →
金融数据服务架构设计与实操:一致性、幂等性与对账系统 2026/9/25 6:54:52

金融数据服务架构设计与实操:一致性、幂等性与对账系统

1. 金融数据服务项目的整体架构设计思路1.1 为什么金融场景对数据服务的要求完全不同做金融数据服务和做一般的互联网数据服务,思路差别非常大。普通业务的数据接口,偶尔延迟个几百毫秒、丢一两条记录,用户基本无感知。但金融场景不一样——一…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉