2026年6月文章 3 篇
RLHF (Reinforcement Learning from Human Feedback) —— 基于人类反馈的强化学习
系统拆解RLHF的三步流程、核心算法原理、代码实现细节以及面临的挑战,涵盖SFT、奖励模型训练、PPO优化、奖励黑客等核心议题,并探讨DPO、RLAIF等演进方向。
AI_Alignment
15 min
SFT (Supervised Fine-Tuning)—— 监督微调
深入剖析监督微调(SFT)的核心原理,涵盖最大似然估计与交叉熵损失的数学推导、Loss Masking 代码实现、灾难性遗忘与不完全学习现象(ILP)等系统挑战,以及数据质量、分层学习率等最佳实践。全面理解 SFT 作为 LLM 后训练基石的定位、优势与演进方向。
AI_Alignment
16 min
PEFT (Parameter-Efficient Fine-Tuning) —— 参数高效微调
系统解析PEFT技术体系,涵盖Adapter Tuning、Prefix Tuning、Prompt Tuning、LoRA、QLoRA、AdaLoRA、IA3等核心方法的数学原理、代码实现与选型指南,探讨低秩假设、矩阵分解、参数重参数化等深刻思想,以及前沿进展与未来方向。
AI_Alignment
19 min