新闻详情

新闻详情

首页 / 资讯中心 / 详情

RL-算法01-SAC04:SAC Actor Loss完整推导【Soft Policy Iteration、KL散度、Reparameterization Trick与Tanh Gaussian】

发布时间:2026/9/28 21:20:00来源:尧图网络
RL-算法01-SAC04:SAC Actor Loss完整推导【Soft Policy Iteration、KL散度、Reparameterization Trick与Tanh Gaussian】
第4部分:SAC Actor Loss完整推导——Soft Policy Iteration、KL散度、Reparameterization Trick与Tanh Gaussian Policy上一部分完成了 SAC Critic 的数学推导:Q(st,at)=rt+γE[Q(st+1,at+1)−αlog⁡π(at+1∣st+1)]Q(s_t,a_t)=r_t+\gamma E[Q(s_{t+1},a_{t+1})-\alpha\log\pi(a_{t+1}|s_{t+1})]Q(st​,at​)=rt​+γE[Q(st+1​,at+1​)−αlogπ(at+1​∣st+1​)]得到:SoftBellmanEquation\text{Soft Bellman Equation}SoftBellmanEquation以及:LQ=12(Qϕ(s,a)−y)2L_Q=\frac12(Q_\phi(s,a)-y)^2LQ​=21​(Qϕ​(s,a)−y)2但是还有一个核心问题:Critic 已经学习了动作价值,那么 Actor 如何根据 Q 函数更新策略?也就是:为什么 SAC 的 Actor Loss 是:Lπ(θ)=Es∼D,a∼πθ[αlog⁡πθ(a∣s)−Qϕ(s,a)]L_\pi(\theta)=E_{s\sim D,a\sim\pi_\theta}[\alpha\log\pi_\theta(a|s)-Q_\phi(s,a)]Lπ​(θ)=Es∼D,a∼πθ​​[αlogπθ​(a∣s)−Qϕ​(s,a)]本部分完整推导这个公式。48. 从Policy Improvement理解SAC Actor更新强化学习中的经典思想:Policy Iteration包含两个过程:渲染错误:Mermaid 渲染失败: Parse error on line 7: ...aluation -- Q[估计 Qπ(s,a)]Q -- Improv -----------------------^ Expecting 'SQE', 'DOUBLECIRCLEEND', 'PE', '-)', 'STADIUMEND', 'SUBROUTINEEND', 'PIPE', 'CYLINDEREND', 'DIAMOND_STOP', 'TAGEND', 'TRAPEND', 'INVTRAPEND', 'UNICODE_TEXT', 'TEXT', 'TAGSTART', got 'PS'48.1 Policy Evaluation目标:给定策略:π\piπ计算:Qπ(s,a)Q^\pi(s,a)Qπ(s,a)即:当前策略执行动作后的长期收益。48.2 Policy Improvement传统强化学习:选择最大Q动作:π′(a∣s)=argmaxaQπ(s,a)\pi'(a|s)=argmax_aQ^\pi(s,a)π′(a∣s)=argmaxa​Qπ(s,a)即:哪个动作价值最高,就选择哪个。49. 为什么SAC不能直接argmax Q?对于离散动作:例如:a∈{ a1,a2,a3}a\in\{a_1,a_2,a_3\}a∈{a1​,a2​,a3​}可以计算:Q(s,a1) Q(s,a_1)Q(s,a1​)Q(s,a2) Q(s,a_2)Q(s,a2​)Q(s,a3) Q(s,a_3)Q(s,a3​)然后:argmaxaQ(s,a) argmax_aQ(s,a)argmaxa​Q(s,a)但是连续动作:例如机械臂:a=[a1,a2,...,an]a=[a_1,a_2,...,a_n]a=[a1​,a2​,...,an​]动作空间:a∈Rna\in R^na∈Rn动作数量无限。无法计算:argmaxaQ(s,a)argmax_aQ(s,a)argmaxa​Q(s,a)DDPG解决:学习一个确定性Actor:a=μθ(s)a=\mu_\theta(s)a=μθ​(s)直接近似:argmaxaQ(s,a)argmax_aQ(s,a)argmaxa​Q(s,a)SAC进一步改变:不寻找单一最大动作,而寻找:高Q+高熵的动作分布 \text{高Q + 高熵的动作分布}高Q+高熵的动作分布50. SAC Policy Improvement目标SAC优化:Jπ(θ)=Es∼D,a∼πθ[Qϕ(s,a)−αlog⁡πθ(a∣s)]J_\pi(\theta)=E_{s\sim D,a\sim\pi_\theta}[Q_\phi(s,a)-\alpha\log\pi_\theta(a|s)]Jπ​(θ)=Es∼D,a∼πθ​​[Q
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

树莓派V4L2+DMA-BUF零拷贝采集实战:CPU占用从62%降至15% 2026/9/28 22:16:24

树莓派V4L2+DMA-BUF零拷贝采集实战:CPU占用从62%降至15%

1. 项目缘起与整体设计思路1.1 为什么要在树莓派上折腾零拷贝采集先说结论:如果你只是用 OpenCV 的cv2.VideoCapture在树莓派上抓 USB 摄像头的画面,大概率会遇到两个问题——CPU 占用高得离谱,以及帧率上不去。我最早在树莓派 4B 上跑一个人…

阅读更多 →
C# FTP服务器源码带Web管理端:协议解析、文件传输与后台部署 2026/9/28 22:16:24

C# FTP服务器源码带Web管理端:协议解析、文件传输与后台部署

简介:面向需要深入学习FTP协议实现及服务器端开发的C#工程师,这是一套功能较为完整的FTP服务器源码,包含Web端与后台管理界面。代码实现文件管理、传输控制、权限分配、日志记录等核心功能,支持通过IE浏览器/资源管理器、ftp命令、…

阅读更多 →
RK3588 NPU部署YOLOv5:INT8量化转换与推理加速实战 2026/9/28 22:16:17

RK3588 NPU部署YOLOv5:INT8量化转换与推理加速实战

1. 为什么要在RK3588上折腾YOLOv5量化手里有块RK3588的板子,6TOPS的NPU算力标称值看着很诱人,但真要把YOLOv5这类目标检测模型跑上去,很多人第一步就卡住了——直接拿PyTorch的权重文件丢进去,要么根本加载不了,要么推…

阅读更多 →
STM32CubeIDE汉化与主题定制实战指南 2026/9/28 22:15:54

STM32CubeIDE汉化与主题定制实战指南

1. 这不是普通安装教程:为什么STM32CubeIDE的汉化和主题修改值得花30分钟认真对待STM32CubeIDE,这个由ST官方推出的免费集成开发环境,这几年在嵌入式初学者和中小项目团队中迅速铺开。它把原先分散在STM32CubeMX、GCC工具链、OpenOCD调试器、…

阅读更多 →
水稻病虫害识别Python机器学习项目实战指南 2026/9/28 22:15:47

水稻病虫害识别Python机器学习项目实战指南

简介:本资源是一个基于Python机器学习技术构建的水稻病虫害自动识别系统,面向农业信息化开发者、计算机视觉初学者及智慧农业项目实践者,旨在解决田间图像中常见病虫害的快速分类与识别问题。压缩包共312个文件,体量为2.56MB&…

阅读更多 →
Substrate区块链框架实战:从架构到Pallet开发与无分叉升级 2026/9/28 22:15:40

Substrate区块链框架实战:从架构到Pallet开发与无分叉升级

讲个可能让不少人意外的事实:如果你在一个技术社区搜索框里敲下 substrate 这个单词,跳出来的结果大概率是三类东西——生物化学里酶催化的“底物”、半导体行业里的“衬底”,以及近几年区块链开发圈里几乎被它独占的“Substrate 区块链开发…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉