LOADING

2026年7月文章 8 篇

RLVR (Reinforcement Learning with Verifiable Rewards) —— 可验证奖励强化学习

RLVR (Reinforcement Learning with Verifiable Rewards) —— 可验证奖励强化学习

系统梳理RLVR(Reinforcement Learning with Verifiable Rewards)的核心思想、数学形式化、主流算法(PPO、GRPO、PACS、ROVER)及训练流程,对比RLHF与RLVR的本质差异,并探讨验证器可靠性、奖励稀疏等核心挑战与前沿解决方案。

AI_Alignment
24 min
大模型强化学习对齐方案:PPO、GRPO、DPO、DAPO与GSPO技术详解与对比

大模型强化学习对齐方案:PPO、GRPO、DPO、DAPO与GSPO技术详解与对比

从12个核心维度系统对比PPO、GRPO、DPO、DAPO与GSPO五种大模型强化学习对齐算法,剖析其技术演进脉络、核心机制与适用场景,揭示从"通用重器"到"专属利刃"的进化逻辑。

AI_Alignment
22 min
GSPO (Group Sequence Policy Optimization) -- 群组序列策略优化

GSPO (Group Sequence Policy Optimization) -- 群组序列策略优化

系统梳理GSPO群组序列策略优化的核心原理,解析其如何通过序列级重要性比率与长度归一化从根本上修复GRPO的token级采样缺陷,解决MoE专家震荡与长序列方差累积问题,并探讨GSPO的局限与后续演进。

AI_Alignment
30 min
DAPO (Decoupled Clip and Dynamic sAmpling Policy Optimization) -- 解耦裁剪与动态采样策略优化

DAPO (Decoupled Clip and Dynamic sAmpling Policy Optimization) -- 解耦裁剪与动态采样策略优化

系统梳理DAPO解耦裁剪与动态采样策略优化的核心技术原理,解析Clip-Higher、Dynamic Sampling、Token-Level Loss与Overlong Reward Shaping四项创新如何解决GRPO在长CoT场景下的熵崩塌与训练不稳定问题,将GRPO从实验室算法打磨为工业级系统。

AI_Alignment
36 min
GRPO (Group Relative Policy Optimization) -- 群体相对策略优化

GRPO (Group Relative Policy Optimization) -- 群体相对策略优化

系统梳理GRPO群体相对策略优化的核心原理、组内相对优势估计机制与训练流程,解析其如何通过移除价值网络实现显存占用降低40%以上,并对比GRPO与PPO、DPO的差异及各自适用场景。

AI_Alignment
36 min
DPO (Direct Preference Optimization) -- 直接偏好优化

DPO (Direct Preference Optimization) -- 直接偏好优化

系统梳理DPO直接偏好优化的核心原理、数学推导与实现机制,解析其如何将RLHF的多阶段流程简化为单阶段监督学习,并对比DPO与PPO的差异及各自适用场景。

AI_Alignment
29 min
PPO(Proximal Policy Optimization) -- 近端策略优化

PPO(Proximal Policy Optimization) -- 近端策略优化

系统梳理PPO近端策略优化的核心思想、目标函数、训练流程与优缺点,解析其在LLM强化学习对齐中的应用,并探讨PPO的局限与后续演进方向。

AI_Alignment
29 min
强化学习基础 -- 策略梯度、优势函数、重要性采样与KL散度惩罚

强化学习基础 -- 策略梯度、优势函数、重要性采样与KL散度惩罚

系统梳理策略梯度、优势函数、重要性采样与KL散度惩罚的核心概念,串联从VPG到PPO的技术演进逻辑,并探讨On-Policy与Off-Policy的权衡及数据漂移问题。

AI_Alignment
34 min
Directory
Albums
Diary
Posts
Projects
Skills
Timeline
Categories
Tags
Table of Contents