Residual¶
输入为x,普通网络学习映射:
\[
H(x) = y
\]
残差网络则改为学习:
\[
F(x) = H(x) - x
\]
最终输出为:
\[
y = F(x) + x
\]
残差解决了什么问题: - 梯度传播困难 - 深层网络退化 - 保留原始信息
Transformer中的残差连接¶
LLM的Transformer中一般有两条残差路径:
\[
\begin{aligned}
x' = x + Attention(Norm(x)) \\
y = x' + MLP(Norm(x'))
\end{aligned}
\]
- 一般残差不参与量化,因为量化误差随residual stream累计
量化的activation通常是经过Norm之后的x.