跳转至

Residual

输入为x,普通网络学习映射:

\[ H(x) = y \]

残差网络则改为学习:

\[ F(x) = H(x) - x \]

最终输出为:

\[ y = F(x) + x \]

残差解决了什么问题: - 梯度传播困难 - 深层网络退化 - 保留原始信息

Transformer中的残差连接

LLM的Transformer中一般有两条残差路径:

\[ \begin{aligned} x' = x + Attention(Norm(x)) \\ y = x' + MLP(Norm(x')) \end{aligned} \]
  • 一般残差不参与量化,因为量化误差随residual stream累计

量化的activation通常是经过Norm之后的x.