知识库 - Orange

Reinforce Learning 概述

2026-03-31

强化学习基础 RL基础概念贝尔曼方程（Bellman Equation) 贝尔曼最优方程(Bellman Optimality Equation) 价值迭代和策略迭代强化学习Model-Free之蒙特卡洛强化学习Model-Free之时序差分从价值函数到DQN 策略梯度方法（Policy Gradient Methods） Actor-Critic Methods 改进算法从DPG到DDPG LLM中的RL DPO(Direct Preference Optimization) GRPO(Group Relative Policy Optimization)

#Reinforcement Learning

READ

Actor-Critic Methods

Reinforcement Learning

2026-03-31

概述与理论背景 Actor-Critic方法是强化学习中的一类重要算法，它巧妙地结合了基于策略(policy-based)和基于价值(value-based)的方法。在这种结构中， "Actor"指策略更新步骤，负责根据策略执行动作；而"Critic"指价值更新步骤，负责评估Actor的表现。从另一个角度看，Actor-Critic方法本质上仍是策略梯度算法，可以通过扩展策略梯度算法获得。 Actor-Critic方法在强化学习中的位置非常重要，它既保留了策略梯度方法直接优化策略的优势，又利用了值函数方法的效率。这种结合使得Actor-Critic方法成为解决复杂强化学习问题的强大工具。最简单的Actor-Critic算法(QAC) QAC算法通过扩展策略梯度方法得到。策略梯度方法的核心思想是通过最大化标量度量 \(J(\theta)\) 来搜索最优策略。其梯度上升算法为： \[\begin{equation}\begin{aligned}\theta_{t+1} &= \theta_t + \alpha\nabla_\theta J(\theta_t)\\&=...

#Reinforcement Learning #Policy Gradient

READ

策略梯度方法（Policy Gradient Methods）

Reinforcement Learning

2026-03-31

引言与背景策略梯度方法是强化学习中的一种重要方法，它标志着从基于价值的方法向基于策略的方法的重要转变。之前我们主要讨论了基于价值的方法（value-based），而策略梯度方法则直接优化策略函数(policy-based)，这是一个重要的进步。当策略用函数表示时，策略梯度方法的核心思想是通过优化某些标量指标来获得最优策略。与传统的表格表示策略不同，策略梯度方法使用参数化函数 \(\pi(a|s, \theta)\) 来表示策略，其中 \(\theta \in \mathbb{R}^m\) 是参数向量。这种表示方法也可以写成其他形式，如 \(\pi_\theta(a|s)\) 、 \(\pi_\theta(a, s)\) 或 \(\pi(a, s, \theta)\) 。策略梯度方法具有多种优势：更高效地处理大型状态/动作空间具有更强的泛化能力样本使用效率更高策略表示：从表格到函数当策略的表示从表格转变为函数时，存在以下几个关键区别：最优策略的定义：表格表示：最优策略是使每个状态值最大化的策略函数表示：最优策略是使某些标量指标最大化的策略策略更新方式：...

#Reinforcement Learning #Policy Gradient

READ

从DPG到DDPG

Reinforcement Learning

2026-03-30

引言 DDPG同样使用了Actor-Critic的结构，Deterministic的确定性策略是和随机策略相对而言的，对于某一些动作集合来说，它可能是连续值，或者非常高维的离散值，这样动作的空间维度极大。如果我们使用随机策略，即像DQN一样研究它所有的可能动作的概率，并计算各个可能的动作的价值的话，那需要的样本量是非常大才可行的。于是有人就想出使用确定性策略来简化这个问题。作为随机策略，在相同的策略，在同一个状态 \(s\) 处，采用的动作 \(\pi_\theta(a|s)\) 是基于一个概率分布的，即是不确定的。而确定性策略则决定简单点，虽然在同一个状态处，采用的动作概率不同，但是最大概率只有一个，如果我们只取最大概率的动作，去掉这个概率分布，那么就简单多了。即作为确定性策略，相同的策略，在同一个状态处，动作是唯一确定的，即策略变成 \[a = \mu(s, \theta)\] 所以DDPG基于确定性策略梯度(DPG)算法，结合了DQN的成功经验。使用回放缓冲区中的样本进行离策略训练，以减少样本之间的相关性使用目标Q网络在时序差分更新过程中提供一致的目标...

#Policy Gradient #Reinforcement Learning

READ

从价值函数到DQN

Reinforcement Learning

2026-03-30

引言与背景价值函数方法是强化学习中的核心技术，它解决了传统表格方法在处理大型状态或动作空间时的效率问题。本文探讨了从表格表示向函数表示的转变，这是强化学习算法发展的重要里程碑。在强化学习的发展路径中，价值函数方法位于从基于模型到无模型、从表格表示到函数表示的演进过程中。它结合了时序差分学习的思想，并通过函数近似技术来处理复杂环境。价值表示：从表格到函数表格与函数表示的对比传统的表格方法将状态值存储在一个表格中：状态 \(s_1\) \(s_2\) \(\cdots\) \(s_n\) 估计值 \(\hat{v}(s_1)\) \(\hat{v}(s_2)\) \(\cdots\) \(\hat{v}(s_n)\) 而函数近似方法则使用参数化函数来表示这些值，例如： \[\hat{v}(s, w) = as + b = [s, 1] \begin{bmatrix} a \\ b \end{bmatrix} = \phi^T(s)w\] 其中 \(\phi(s)\in\mathbb{R}^2\) 称作是状态 \(s\) 的特征向量， \(w\) 是参数向量。...

#Reinforcement Learning #Q-Learning

READ

DPO(Direct Preference Optimization)

Reinforcement Learning

2026-03-30

背景 RLHF 通常包括三个阶段：有监督微调（SFT） RLHF首先通过在高质量数据上进行监督学习来微调预训练的语言模型，得到模型 \(\pi_{SFT}\) 。奖励建模阶段（Reward Model）在第二阶段，SFT模型根据提示 \(x\) 生成答案对 \((y_1, y_2) \sim \pi_{SFT}(y|x)\) 。这些答案对呈现给人类标注者，他们表达对一个答案的偏好，表示为 \(y_w \succ y_l|x\) ，其中 \(y_w\) 和 \(y_l\) 分别表示在 \((y_1, y_2)\) 中更受偏好和不受偏好的答案。这些偏好被假定由某个潜在的奖励模型 \(r^*(y, x)\) 生成，我们无法直接访问该模型。一种流行的建模偏好的方法是Bradley-Terry（BT）模型，该模型规定人类偏好分布 \(p^*\) 可以写为： \[p^*(y_1 \succ y_2|x) = \frac{\exp(r^*(x, y_1))}{\exp(r^*(x, y_1)) + \exp(r^*(x, y_2))} \] 假设我们有一个从 \(p^*\)...

#Reinforcement Learning #LLM

READ

强化学习Model-Free之时序差分

Reinforcement Learning

2026-03-30

引言时序差分（Temporal-Difference，TD）方法是强化学习中的一类核心算法，它结合了动态规划与蒙特卡洛方法的优点。TD方法是无模型（model-free）学习方法，不需要环境模型即可学习价值函数和最优策略。 TD方法的核心特点是通过比较不同时间步骤的估计值之间的差异来更新价值函数，这种差异被称为"时序差分误差"（TD error）。TD方法可以被视为解决贝尔曼方程或贝尔曼最优方程的特殊随机逼近算法。基础TD算法：状态值函数学习给定策略 \(\pi\) ，基础TD算法用于估计状态值函数 \(v_\pi(s)\) 。假设我们有一些按照策略 \(\pi\) 生成的经验样本 \((s_0, r_1, s_1, ..., s_t, r_{t+1}, s_{t+1}, ...)\) ，TD算法的更新规则为： \[\begin{equation}\begin{aligned}v_{t+1}(s_t) &= v_t(s_t) - \alpha_t(s_t)[v_t(s_t) - (r_{t+1} + \gamma v_t(s_{t+1}))]\\ v_{t+1}(s) &=...

#Reinforcement Learning #Q-Learning

READ

强化学习Model-Free之蒙特卡洛

Reinforcement Learning

2026-03-30

引言与背景蒙特卡洛方法是强化学习中的重要算法类别，它标志着从基于模型到无模型算法的转变。这类算法不依赖环境模型，而是通过与环境的直接交互获取经验数据来学习最优策略。蒙特卡洛方法在强化学习算法谱系中处于"无模型"方法的起始位置，是从基于模型的方法（如值迭代和策略迭代）向无模型方法过渡的第一步。无模型强化学习的核心理念可以简述为：如果没有模型，我们必须有数据；如果没有数据，我们必须有模型；如果两者都没有，我们就无法找到最优策略。在强化学习中，"数据"通常指智能体与环境交互的经验。均值估计问题在介绍蒙特卡洛强化学习算法之前，我们首先需要理解均值估计问题，这是理解从数据而非模型中学习的基础。考虑一个可以取有限实数集合 \(X\) 中值的随机变量 \(X\) ，我们的任务是计算 \(X\) 的均值或期望值： \(E[X]\) 有两种方法可以计算 \(E[X]\) ：基于模型的方法：当已知随机变量的概率分布时，可以直接根据期望值的定义计算： \[E[X] = \sum_{x \in X} p(x) \cdot x\] 其中 \(p(x)\) 是 \(X\) 取值为 \(x\)...

#Q-Learning #Reinforcement Learning

READ

贝尔曼最优方程(Bellman Optimality Equation)

Reinforcement Learning

2026-03-27

最优策略（Optimal Policy ）之前在贝尔曼方程（Bellman Equation) 中说过，状态值可以用来评估一个策略是好是坏，这里给出正式的概念： \[v_{\pi_1}(s) \geq v_{\pi_2}(s) \quad \text { for all } s \in \mathcal{S}\] 那么此时 \(\pi_1\) 比 \(\pi_2\) ”更好“ 最优状态值（Optimal State Value）：对于任意状态 \(s\) ，最优状态值 \(v^*(s)\) 是所有可能策略中状态值的最大值： \[v^*(s) = \max_{\pi} v_{\pi}(s)\] 其中 \(v_{\pi}(s)\) 是策略 \(\pi\) 下的状态值。最优策略（Optimal Policy）：如果一个策略的状态值在所有状态中均大于或等于其他策略的状态值，则该策略为最优策略： \[\pi^* = \arg\max_{\pi} v_{\pi}(s), \forall s \in S\] 即最优策略总是选择使得状态值最大的动作。性质：存在性...

#Reinforcement Learning

READ

贝尔曼方程（Bellman Equation)

Reinforcement Learning

2026-03-27

状态价值（State values）定义状态价值是强化学习中的核心概念，用于衡量Agent从某个状态出发、遵循特定策略后所能获得的期望回报。数学表达为： \[ v_\pi(s) = \mathbb{E}[G_t | S_t = s] \tag{1}\] 其中： \(v_\pi(s)\) ：状态 \(s\) 的状态价值函数（state-value function）或者简称为状态价值（state value）； \(\pi\) ：智能体遵循的策略； \(G_t = R_{t+1} + \gamma R_{t+2} + \gamma^2 R_{t+3} + \dots\) ：从当前时间步 \(t\) 开始的折扣回报； \(\gamma \in (0, 1)\) ：折扣因子，用于平衡即时奖励和未来奖励。状态价值的特点依赖于状态 \(s\) ：状态价值是条件期望，条件是智能体从状态 \(s\) 开始。依赖于策略 \(\pi\) ：不同策略会生成不同的轨迹，从而影响状态价值。与时间步无关：状态价值是一个固定值，与当前时间步 \(t\) 无关。代表一个状态的价值。...

#Reinforcement Learning

READ

价值迭代和策略迭代

Reinforcement Learning

2026-03-27

引言强化学习中，找到最优策略是核心目标。本文详细介绍三种能够找到最优策略的基础算法：价值迭代、策略迭代和截断策略迭代。这些算法属于动态规划范畴，需要系统模型，是后续无模型强化学习算法的重要基础。在强化学习的发展路线中，这些算法处于"基础工具"到"算法/方法"的过渡阶段，是从"有模型"到"无模型"学习的重要桥梁。价值迭代（Value iteration）价值迭代算法基于收缩映射定理求解贝尔曼最优方程。其核心迭代公式为： \[\begin{equation}v_{k+1} = \max_{\pi \in \Pi} (r_\pi + \gamma P_\pi v_k), k = 0, 1, 2, ...\tag{1}\end{equation}\] 根据收缩映射定理，当 \(k \to \infty\) 时， \(v_k\) 和 \(\pi_k\) 分别收敛到最优状态值和最优策略。每次迭代包含两个步骤：策略更新步骤（policy update step）：找到能解决以下优化问题的策略 \[\pi_{k+1} = \arg\max_\pi (r_\pi +...

#Reinforcement Learning

READ

RL基础概念

Reinforcement Learning

2026-03-27

基础概念 Grid-Word Example 环境描述：网格世界是一个直观的二维环境，包含：白色格子：可通行区域。橙色格子：禁止进入的区域（禁区）。目标格子：代理需要到达的目标位置。任务目标：找到一条“好的”策略，使代理从任意初始位置到达目标格子。策略应避免进入禁区、碰撞边界或走不必要的弯路。什么是强化学习：依据策略执行动作-感知状态-得到奖励所谓强化学习(Reinforcement Learning，简称RL)，是指基于智能体在复杂、不确定的环境中最大化它能获得的奖励，从而达到自主决策的目的。 a computational approach to learning whereby an agent tries to maximize the total amount of reward it receives while interacting with a complex and uncertain environment 经典的强化学习模型可以总结为下图的形式（你可以理解为任何强化学习都包含这几个基本部分：智能体、行为、环境、状态、奖励）：...

#Reinforcement Learning

READ

#

!

INCOMING TRANSMISSION

Reinforce Learning 概述

Actor-Critic Methods

策略梯度方法（Policy Gradient Methods）

从DPG到DDPG

从价值函数到DQN

DPO(Direct Preference Optimization)

强化学习Model-Free之时序差分

强化学习Model-Free之蒙特卡洛

贝尔曼最优方程(Bellman Optimality Equation)

贝尔曼方程（Bellman Equation)

价值迭代和策略迭代

RL基础概念