· 模型原理
位置编码:让注意力理解 Token 在序列中的位置
从 X = E + P 走到 RoPE:为什么 Self-Attention 天生看不见顺序,位置信息又如何只靠点积留下相对距离。
从 X = E + P 走到 RoPE:为什么 Self-Attention 天生看不见顺序,位置信息又如何只靠点积留下相对距离。
从 Sigmoid、Tanh 到 ReLU 家族与 GELU / SwiGLU:梯度消失、神经元死亡,以及 FFN 里到底该用哪个。
微调场景下的前向产物、反向传播机制,以及冻结参数与 LoRA 等不同策略对反向计算图的实际影响。
把 θ ← θ − η∇L(θ) 这行公式拆开,看它落到工程里会分出哪四个问题,再按时间顺序看每一代优化器回答了哪一个。