Zhang Haoyi
Hi, I'm Zhang Haoyi - HUST CS undergrad (2024). I'm an enthusiastic learner, developer and blogger. Welcome to my personal space where I share my thoughts, notes, projects, and experiences.
统计
74文章
8分类
223标签
目录
-
文章
-
ai_agent
- Agent Architecture —— LLM & Planning & Tool & Memory
- Agent Communication Protocols —— MCP & A2A
- Agent Engineering —— Prompt & Context & Harness & Loop
- Agent Paradigms —— ReAct & Plan-and-Solve & Reflection
- Function Calling —— 工具调用
- Memory Mechanisms Evolution: From Storage to Experience —— 智能体记忆机制的演化综述
- Memory System —— Agent记忆系统
- Multi-Agent System—— 多智能体系统
- Recursive Self-Improvement(RSI)—— 递归自我改进综述
- Retrieval-Augmented Generation —— 检索增强生成
- Self-Evolving Agents (What、When、How、Where) —— 自进化智能体综述
-
ai_alignment
- Comparison of RL Algorithm —— PPO、GRPO、DPO、DAPO、GSPO技术详解与对比
- DAPO (Decoupled Clip and Dynamic sAmpling Policy Optimization) -- 解耦裁剪与动态采样策略优化
- DPO (Direct Preference Optimization) -- 直接偏好优化
- GRPO (Group Relative Policy Optimization) -- 群体相对策略优化
- GSPO (Group Sequence Policy Optimization) -- 群组序列策略优化
- PEFT (Parameter-Efficient Fine-Tuning) —— 参数高效微调
- PPO(Proximal Policy Optimization) -- 近端策略优化
- Reinforcement Learning -- 策略梯度、优势函数、重要性采样与KL散度惩罚
- RLHF (Reinforcement Learning from Human Feedback) —— 基于人类反馈的强化学习
- RLVR (Reinforcement Learning with Verifiable Rewards) —— 可验证奖励强化学习
- SFT (Supervised Fine-Tuning)—— 监督微调
-
ai_multimodal
- Contrastive Language-Image Pre-training —— CLIP对比学习
- Denoising Diffusion Probabilistic Models —— DDPM扩散模型
- Multimodal Large Language Model —— MLLM多模态大语言模型
- Multimodal RAG —— 多模态RAG
- Video Audio Multimodal —— 视频理解 & 视频生成 & 音频处理
- Vision Transformer —— ViT视觉Transformer
- Vision-Language Model —— VLM视觉语言模型
- Vision-Language-Action —— VLA具身智能
-
cs336
-
deep_learning
- Activation & Initialization —— 激活函数与权重初始化
- Autograd & Computational Graph —— 自动微分与计算图
- CNN —— 卷积神经网络
- Gradient Descent Optimizer —— 梯度下降优化器
- LSTM & GRU —— 门控循环神经网络
- MLP & Back Propagation —— 多层感知机与反向传播
- Probability & Information —— 概率论与信息论基础
- Residual Network —— ResNet残差网络
- RNN & BPTT —— 循环神经网络与随时间反向传播
- Tensor Operations —— 向量、矩阵与张量运算
-
machine_learning
- Adaptive Boosting (AdaBoost) —— 自适应提升
- Bagging & Random Forest —— 随机森林
- Decision Tree —— 决策树
- Expectation-Maximization Algorithm —— EM算法
- Gradient Boosting Machine (GBM) —— 梯度提升机与加法模型
- Hidden Markov Model (HMM) —— 隐马尔可夫模型
- K-Means Clustering —— 聚类算法
- K-Nearest Neighbor (KNN) —— K-近邻
- Kernel Trick —— 核技巧与常用核函数
- Linear Regression —— 线性回归
- Logistic Regression —— 逻辑回归与Softmax多分类
- Naive Bayes —— 朴素贝叶斯
- Principal Component Analysis (PCA) —— 主成分分析
- Support Vector Machine (SVM) —— 支持向量机
- XGBoost & LightGBM —— 梯度提升框架
-
-
相册
-
IB_Course
-
Calculus
-
Data Strctures
-
Discrete Mathematics
-
Physics Experiment
-
Physics(1)
-
Probability and Statistic
-
-
IIA_Course
-
Algorithm
-
Digital Circuits
-
Physics(2)
-
-
IIB_Course
-
Computer Organization
-
Database
-
MaoZedong
-
Signal and Linear Systems
-
-
Scenery
-
-
项目展示
-
CME295
-
CS336
-
分类
标签
Transformer Inference Generation —— 推理生成式语言模型
系统讲解语言模型推理生成的完整技术栈:从自回归生成的本质出发,剖析温度采样、Top-k采样与Top-p三种生成策略的工作原理与参数调节;详解从检查点恢复训练权重的加载机制;完整拆解从原始文本到生成文本的端到端推理数据流;深入剖析KV Cache的核心原理及其代价与前沿优化方向。全文总结整个从零构建Transformer系列的技术栈全景与未来扩展方向。
4721 字
|
24 分钟
Transformer Training Experiments —— 完整训练实战与消融实验
系统讲解基于argparse的命令行训练脚本设计与五组消融实验的科学验证:从高度参数化的训练框架出发,设计五组对照实验以量化各组件贡献;基于训练损失/验证损失/困惑度/梯度范数等多维度指标分析,得出各组件重要性排序;展示完整的训练循环实现及自动化批量实验的工程价值。附有完整命令行参数体系与实验配置。
5969 字
|
30 分钟
Transformer Training System —— 完整训练系统
系统讲解语言模型训练的核心系统组件:从数值稳定的交叉熵损失出发,剖析基于np.memmap的高效数据加载器与随机采样批次生成逻辑;从零推导AdamW优化器的完整更新公式;设计余弦退火学习率调度器;实现基于全局L2范数的梯度裁剪以防止梯度爆炸。完整展示从数据到优化器的训练闭环。
4450 字
|
22 分钟
TransformerBlock & TransformerLM —— 完整语言模型
系统讲解如何将Transformer的各个组件组合成完整的可训练语言模型:从TransformerBlock的Pre-Norm与Post-Norm架构对比入手,剖析残差连接如何保障深层网络梯度流动;深入模块化设计中的权重加载接口;拆解TransformerLM四大核心组件(Token Embedding → N层TransformerBlock → Final RMSNorm → LM Head)及其超参数设计的权衡考量;完整跟踪从token ID到logits的前向传播数据流(形状变换全程)。
3713 字
|
19 分钟
Attention Mechanism —— 从缩放点积到因果多头注意力
系统讲解Transformer注意力机制的核心原理与完整实现:从数值稳定的Softmax出发,推导缩放点积注意力的数学公式与几何意义;深入剖析因果掩码的下三角矩阵机制及其在自回归语言模型中的关键作用;详解多头注意力的拆分与合并逻辑及并行计算优势;最后阐述RoPE旋转位置编码如何直接融入注意力计算,与因果掩码协同实现带位置感知的因果注意力。
3831 字
|
19 分钟
Transformer Core Modules —— 从线性层到位置编码
系统讲解Transformer核心模块的从零实现:从线性层的矩阵乘法本质与截断正态初始化策略出发,深入词嵌入层的查表机制与参数规模计算;推导RMSNorm相比LayerNorm的归一化原理与计算效率优势;剖析SwiGLU门控激活函数的三矩阵结构(W₁/W₂/W₃)及其参数量权衡;最后完整推导RoPE旋转位置编码的数学原理——从二维平面旋转矩阵到复数视角的高维扩展,以及theta参数对旋转频率的控制与编码质量的影响。
4850 字
|
24 分钟
BPE(Byte-Pair Encoding) Tokenizer —— 从零构建BPE分词器
系统讲解字节级BPE(Byte-Pair Encoding)分词器的完整实现原理与代码。从词级分词与字符级分词的困境出发,剖析GPT-2风格字节级BPE的优势;详细拆解预分词阶段GPT-2正则表达式含义;深入推导BPE训练的核心数据结构与贪心合并循环的频率更新逻辑;详解编码时按合并优先级应用规则的确定性流程;最后在TinyStories数据集上训练出18,017词汇量的分词器并生成.dat文件供模型训练使用。
5753 字
|
29 分钟
Lecture 9:LLM development
系统梳理大语言模型在跨模态与前沿技术方向的核心进展,涵盖Transformer多模态泛化本质、ViT与VLM的视觉适配方案、扩散LLMs(MDM)的并行生成突破、跨模态技术交叉融合(扩散架构/Transformer/MSRoPE/DeepSeek-OCR)、LLM基础研究趋势(帕累托优化/类存内计算)及应用场景与未来展望,最后提供学术与工程跟进渠道。
3759 字
|
19 分钟
Lecture 8:LLM evaluation
系统梳理大语言模型评估的完整方法论体系,涵盖人工评分的黄金标准与卡帕系数一致性量化、规则化指标(METEOR/BLEU/ROUGE)的算法原理与局限、LLM-as-a-Judge(LaaJ)的核心流程与偏置缓解、事实性量化方法(Fact Decomposition)、智能体工具调用全流程故障模式与排查,以及主流基准测试(MMLU/AIME/SWE-bench/HarmBench/τ-bench)与Pass^k/帕累托前沿/数据污染等核心概念。
5885 字
|
29 分钟