
RLVR (Reinforcement Learning with Verifiable Rewards) —— 可验证奖励强化学习
系统梳理RLVR(Reinforcement Learning with Verifiable Rewards)的核心思想、数学形式化、主流算法(PPO、GRPO、PACS、ROVER)及训练流程,对比RLHF与RLVR的本质差异,并探讨验证器可靠性、奖励稀疏等核心挑战与前沿解决方案。
阅读文章ZHY's Blog
A UNIVERSE OF IDEAS · BY ZHANG HAOYI
让好奇心 点亮知识宇宙
在代码、模型与思想之间自由漫游。这里持续记录人工智能、机器学习、软件工程与成长实践,让每次阅读都成为一次新的发现。
11 篇文章 · 分类

系统梳理RLVR(Reinforcement Learning with Verifiable Rewards)的核心思想、数学形式化、主流算法(PPO、GRPO、PACS、ROVER)及训练流程,对比RLHF与RLVR的本质差异,并探讨验证器可靠性、奖励稀疏等核心挑战与前沿解决方案。
阅读文章
从12个核心维度系统对比PPO、GRPO、DPO、DAPO与GSPO五种大模型强化学习对齐算法,剖析其技术演进脉络、核心机制与适用场景,揭示从"通用重器"到"专属利刃"的进化逻辑。
阅读文章
系统梳理GSPO群组序列策略优化的核心原理,解析其如何通过序列级重要性比率与长度归一化从根本上修复GRPO的token级采样缺陷,解决MoE专家震荡与长序列方差累积问题,并探讨GSPO的局限与后续演进。
阅读文章
系统梳理DAPO解耦裁剪与动态采样策略优化的核心技术原理,解析Clip-Higher、Dynamic Sampling、Token-Level Loss与Overlong Reward Shaping四项创新如何解决GRPO在长CoT场景下的熵崩塌与训练不稳定问题,将GRPO从实验室算法打磨为工业级系统。
阅读文章
系统梳理GRPO群体相对策略优化的核心原理、组内相对优势估计机制与训练流程,解析其如何通过移除价值网络实现显存占用降低40%以上,并对比GRPO与PPO、DPO的差异及各自适用场景。
阅读文章
系统梳理DPO直接偏好优化的核心原理、数学推导与实现机制,解析其如何将RLHF的多阶段流程简化为单阶段监督学习,并对比DPO与PPO的差异及各自适用场景。
阅读文章
系统梳理PPO近端策略优化的核心思想、目标函数、训练流程与优缺点,解析其在LLM强化学习对齐中的应用,并探讨PPO的局限与后续演进方向。
阅读文章
系统梳理策略梯度、优势函数、重要性采样与KL散度惩罚的核心概念,串联从VPG到PPO的技术演进逻辑,并探讨On-Policy与Off-Policy的权衡及数据漂移问题。
阅读文章
系统拆解RLHF的三步流程、核心算法原理、代码实现细节以及面临的挑战,涵盖SFT、奖励模型训练、PPO优化、奖励黑客等核心议题,并探讨DPO、RLAIF等演进方向。
阅读文章
深入剖析监督微调(SFT)的核心原理,涵盖最大似然估计与交叉熵损失的数学推导、Loss Masking 代码实现、灾难性遗忘与不完全学习现象(ILP)等系统挑战,以及数据质量、分层学习率等最佳实践。全面理解 SFT 作为 LLM 后训练基石的定位、优势与演进方向。
阅读文章
系统解析PEFT技术体系,涵盖Adapter Tuning、Prefix Tuning、Prompt Tuning、LoRA、QLoRA、AdaLoRA、IA3等核心方法的数学原理、代码实现与选型指南,探讨低秩假设、矩阵分解、参数重参数化等深刻思想,以及前沿进展与未来方向。
阅读文章