文章
共 9 篇,分 3 个专栏。点标题进正文,点专栏名看该专栏全部文章。
分布式训练
3 篇 »参数高效微调
2 篇 »模型原理
4 篇 »位置编码:让注意力理解 Token 在序列中的位置
从 X = E + P 走到 RoPE:为什么 Self-Attention 天生看不见顺序,位置信息又如何只靠点积留下相对距离。
位置编码RoPETransformerAttention激活函数:为神经网络注入非线性
从 Sigmoid、Tanh 到 ReLU 家族与 GELU / SwiGLU:梯度消失、神经元死亡,以及 FFN 里到底该用哪个。
激活函数ReLUGELUSwiGLUFFN前向传播与反向传播概述
微调场景下的前向产物、反向传播机制,以及冻结参数与 LoRA 等不同策略对反向计算图的实际影响。
前向传播反向传播计算图微调梯度下降与优化器:从 SGD 到 Muon
把 θ ← θ − η∇L(θ) 这行公式拆开,看它落到工程里会分出哪四个问题,再按时间顺序看每一代优化器回答了哪一个。
梯度下降SGDAdamAdamWMuon