深度网络退化问题实验复现:残差连接为何能拯救深层网络

一个反直觉的实验现象
一位正在撰写 PyTorch 书籍的作者在 Reddit 上分享了一个有趣的复现实验。在编写关于跳跃连接(skip connections)的章节时,他没有像大多数教材那样直接画出 ResNet 结构图然后告诉读者"它有用",而是决定先亲手复现促使人们发明残差网络的那个失败——即深度网络的退化问题(degradation problem)。
跳跃连接的概念并非凭空出现。2015年,何恺明等人在微软研究院发表的《Deep Residual Learning for Image Recognition》论文中正式提出了 ResNet 架构,该论文在 CVPR 2016 获得最佳论文奖。在此之前,深度学习社区已经观察到一个令人困惑的现象:当网络层数从十几层增加到几十层时,性能反而下降。这与当时"越深越好"的直觉完全矛盾。ResNet 的提出直接推动了网络深度从十几层跃升到上百层甚至上千层,在 ImageNet 竞赛中以 3.57% 的 top-5 错误率首次超越人类水平(约5.1%)。
他的实验设置非常严谨:数据集为 CIFAR-10,训练 40 个 epoch,所有模型使用完全相同的训练配方和随机种子,唯一变化的只有网络深度。CIFAR-10 是由 Alex Krizhevsky 等人于 2009 年发布的经典图像分类基准数据集,包含 60,000 张 32×32 像素的彩色图像,均匀分布在 10 个类别中(飞机、汽车、鸟、猫、鹿、狗、青蛙、马、船、卡车)。由于图像分辨率较低且数据量有限,CIFAR-10 常被用作快速验证网络架构设计的试验场,适合在单 GPU 上短时间内完成实验。
结果如下表所示:
| 模型 | 参数量 | 训练准确率 | 测试准确率 |
|---|---|---|---|
| plain-20 | 269,722 | 95.1% | 88.7% |
| plain-56 | 853,018 | 84.0% | 79.9% |
| ResNet-20 | 272,474 | 97.4% | 90.4% |
| ResNet-56 | 855,770 | 99.0% | 91.7% |

深度网络退化为何"本不应该发生"
真正值得注意的不是测试准确率,而是训练准确率。plain-56 在训练集上只有 84.0% 的准确率,而参数量只有它三分之一的 plain-20 却达到了 95.1%。训练误差分别是 16.0% 和 4.9%。
请注意,这是模型已经"看过 40 遍"的训练数据——拥有三倍参数量的更大模型,反而在它记忆过的数据上表现更差。
从理论上讲,这几乎是不可能的。任何一个 56 层的网络在数学上都能表达 20 层网络所能表达的一切:你只需让多出来的 36 层学习成恒等映射(identity mapping),就能得到与浅层网络完全等价的结果。也就是说,存在一组权重能让 plain-56 达到 95.1% 的训练准确率,但梯度下降没能找到它。
梯度下降是深度学习中最基本的优化方法:通过计算损失函数对参数的梯度,沿梯度反方向更新参数以最小化损失。然而在高维参数空间中,损失曲面(loss landscape)极其复杂,充满了鞍点、局部极小值和平坦区域。对于深度网络,反向传播需要将梯度沿着数十层连续相乘,即使每层的梯度稍小于1,连乘后也会指数级衰减(梯度消失),反之则指数级爆炸(梯度爆炸)。退化问题比梯度消失更加微妙——即使梯度数值正常,优化器也可能陷入次优解区域,无法找到理论上存在的全局最优解。
这个观察极其重要,因为它直接否定了一种常见的错误解释:"更深的网络会过拟合"。作者一针见血地指出——容量从来不是问题所在。凡是从"深层网络过拟合"出发来解释 ResNet 的说法,几乎都是错的。问题的本质是优化困难,而非模型能力不足。
残差连接的核心思想:让恒等映射成为默认选项
那么 ResNet 究竟做对了什么?作者给出了一个直观的解释:
与其要求某一层去学习从输入 x 到输出 y 的完整映射,不如让优化器去学习 x + F(x) 到 y 的映射。在这种配置下,网络只需要学习残差 F(x),而原始信息 x 通过跳跃连接被直接保留下来。这样即使网络变得非常深,x 也不会"被埋没"在层层堆叠之中。
换句话说,恒等映射在残差结构中成了默认选项——如果某一层不需要做任何事,它只需让 F(x) 趋近于零即可,而不必费力地把整层权重学成恒等变换。
理解这一点需要认识到恒等映射的学习难度。恒等映射在数学上是最简单的函数:输出等于输入。但对于一个由卷积层、激活函数和归一化层组成的网络块来说,学习恒等映射并不简单。以一个典型的"Conv→BN→ReLU→Conv→BN"块为例,要让这个块实现恒等变换,卷积核的权重必须被精确设置为特定值(类似于单位矩阵的卷积等价物),而 ReLU 激活函数会将负值截断为零,这使得精确的恒等映射在数学上甚至不可能通过带 ReLU 的路径实现。相比之下,在残差结构中,只需让所有权重趋近于零,输出就自动等于输入——这对优化器来说是自然的默认状态。
这正是 ResNet 论文引入的关键技巧,它把"学习恒等"这件对优化器来说很难的事,变成了"什么都不做"这件容易的事。
仅增加0.3%参数量带来的巨大性能差异
实验中最令人震撼的数字来自参数对比。ResNet-56 相比 plain-56 只多了 2,752 个参数,约占总量的三分之一个百分点。而且这些额外参数仅仅来自通道数变化处的 1×1 投影层,其余结构完全相同。
1×1 卷积(也称为逐点卷积或投影层)最初由 Lin 等人在 Network in Network 论文中引入,后来被广泛应用于各种架构中。在 ResNet 中,当残差块的输入和输出通道数不同时(例如从 64 通道到 128 通道),跳跃连接无法直接将输入加到输出上,因为维度不匹配。此时需要一个 1×1 卷积将输入投影到正确的维度。这种投影层的参数量极少——例如将 64 通道映射到 128 通道只需要 64×128=8,192 个参数,相比整个网络的数十万参数几乎可以忽略不计。
就是这微不足道的三分之一个百分点,把训练准确率从 84.0% 拉升到 99.0%,测试准确率从 79.9% 提升到 91.7%。这生动地说明,深度网络的瓶颈不在于"参数多少",而在于"优化路径是否顺畅"。残差连接几乎不增加任何表达能力,却彻底改变了损失曲面的优化难度。
批归一化无法替代残差连接
作者还分享了一个容易被忽视的细节:他的 plain-56 网络中已经包含了批归一化(Batch Normalization)。
批归一化由 Ioffe 和 Szegedy 于 2015 年提出,其核心操作是对每个 mini-batch 内的特征进行标准化:减去均值、除以标准差,再通过可学习的缩放和偏移参数恢复表达能力。BN 的主要功效包括:稳定训练过程中各层输入的分布(减轻所谓的"内部协变量偏移")、允许使用更大的学习率、以及提供轻微的正则化效果。然而 BN 主要解决的是梯度的尺度问题,确保梯度不会因为层间激活值的尺度变化而消失或爆炸。
这一点之所以重要,是因为业界流传的一个说法是"批归一化解决了梯度消失问题,从而解决了深度训练问题"。但实验清楚地表明:即便有批归一化,plain-56 依然出现了严重退化。这说明退化问题的根源不仅仅是梯度尺度,还涉及损失曲面的几何结构——BN 无法改变优化景观中通往好解的路径是否存在且可达。批归一化至少无法单独解决深度网络的优化难题,跳跃连接的贡献是独立且不可替代的。
复现经典实验的经验教训
作者非常坦诚地列出了实验的局限性:单一数据集、单一随机种子、仅 40 个 epoch,且 CIFAR-10 规模较小。他也强调,退化现象本身并非他的原创发现,而是源自原始 ResNet 论文,他只是想在自己的机器上亲眼见证它。
一个特别有价值的教训是:他的第一次尝试根本没有观察到退化。原因是训练 epoch 太少,两个模型都还处于欠拟合状态,因此无法区分优劣。退化现象只有在 plain-20 真正收敛之后才会显现出来。这提醒我们,复现经典实验时,训练是否充分收敛是能否观察到关键现象的前提。
最后作者留下一个开放问题:在其他数据集上,plain 网络从多少层开始出现退化?他的实验在 20 层和 56 层之间的某处出现了问题,但没有测试中间深度——这或许是一个值得进一步探索的方向。
结语:理解ResNet的正确起点
这篇复现分享的价值,远超一个简单的教材示例。它用干净可控的实验,把"深度网络退化"这个抽象概念变成了可触摸的数字,并清晰地区分了三个常被混淆的问题:模型容量、过拟合与优化难度。理解 ResNet 的正确起点,不是"更深会过拟合",而是"更深会更难优化"——而残差连接,正是为优化器铺就的一条捷径。
核心要点
相关推荐

Nemotron 3.5 Lightning:专为长程Agent设计的高效开源模型
NVIDIA推出Nemotron 3.5 Lightning开源模型,主打智能、快速、高效,专为连续长程Agent任务设计。本文解析其核心优势、开源策略及对AI Agent行业的潜在影响。

从Cursor切换到Claude Code的实战避坑指南
详解从Cursor迁移到Claude Code的核心差异与避坑策略,涵盖操作习惯适配、上下文机制重建、风险控制三步法及调试排查技巧,帮助开发者顺利完成从AI代码助手到自主智能体的范式跨越。

monolog:无需整理的AI笔记应用,语义搜索找回一切
monolog是一款取消文件夹和标签的AI笔记应用,用户只需像聊天一样记录想法,AI自动理解内容并通过语义搜索帮你找回信息。支持iOS、Android、Web等全平台同步。