摘要

深度神经网络(DNNs)容易受到“捷径学习”的影响:它们倾向于在其输入和输出之间建立不完整的关联,而不是学习预定的任务。捷径学习在许多神经网络失败案例中普遍存在,这种现象的痕迹可以在它们的泛化问题、领域偏移、对抗性脆弱性,甚至对多数群体的偏见中看到。在本文中,我们认为这些不同DNN问题的共同原因为我们提供了一个重要的机会,应该被利用来寻找捷径学习的统一解决方案。为此,我们概述了拓扑数据分析(TDA)的最新进展,特别是持久同调(PH),以勾勒出一个用于检测深度学习中捷径的统一路线图。我们通过研究DNNs计算图的拓扑特征,以不可学习样本和决策中的偏见两个案例作为测试研究,来证明我们的论点。我们对这两个DNN失败案例的分析表明,为DNNs中的捷径学习找到一个统一的解决方案并非遥不可及,而TDA可以在形成这样一个框架中发挥重要作用。

introduction

与人类不同,DNNs臭名昭著地依赖虚假特征,并在决策过程中得出毫无意义的结论。例如,考虑一个在总是描绘草地上的牛的数据集上训练的DNN。这样的模型将草地视为虚假特征,并且只在背景包含绿色时检测到牛(见图1)。这个简单的例子表明了DNNs决策中的一个严重缺陷,使得敏感应用依赖于神经网络变得危险。
在这里插入图片描述

虚假相关性被认为是更广泛现象——捷径学习的结果。捷径是神经网络学习到的意外决策规则(例如,检测草地而不是牛)。这些捷径被认为是遵循“最小努力原则”的结果,其中学习意外的解决方案相比实际任务需要更少的努力(例如,检测绿色比检测不同颜色和形状的牛要容易得多)。神经网络的各种失败案例,从领域偏移和对抗性示例到偏见和公平性,都可以追溯到捷径学习。这些失败案例的原因惊人地一致,这为我们提供了一个绝佳的机会,应该被利用来寻找一个统一的解决方案。

在本文中,我们认为拓扑数据分析(TDA)可以在检测和缓解深度学习中的捷径方面发挥无价的作用。特别是,我们证明捷径学习在神经网络的计算图中留下了可追踪的路径。为了揭示这样一个包含数千个神经元的高维空间中的捷径,我们利用持久同调(PH)在揭示神经元之间连接组件方面的表征能力。我们实证地表明,学习这些捷径的神经网络在其计算图的拓扑结构中留下了签名。我们的实验揭示,这些特征与良性神经网络的特征在统计上存在显著差异

为了证明我们的观点,我们选择了DNNs在下游任务中的两个失败案例:不可学习样本和偏见。不可学习样本是添加到训练数据中的不可察觉的扰动,以防止DNN从数据中学习有意义的模式。另一方面,当DNN错误地使用某些敏感属性(如肤色)来做出最终决策时,神经网络中可能会出现偏见。正如我们所见,这两个问题的起源相当不同。然而,我们证明TDA可以为揭示DNNs中的这两种不当行为提供统一的手段。我们令人鼓舞的发现呼吁对神经网络的拓扑分析进行更多研究,以治疗捷径,希望这样的解决方案能够一劳永逸地缓解DNNs的各种失败。

method

在这里插入图片描述
直观上,当DNN从输入到输出学习了一条异常直接的路径时,就会发生这种现象。我们希望通过分析输入信息在神经网络计算图中的传播来揭示这种异常行为。我们借助持久同调(PH)来识别DNNs中的这种异常行为。为此,我们按照Zheng等人 [49] 介绍的方法(计算任意两个神经元之间的相关性,得到一个相关性矩阵。 一个神经网络模型得到一个PD ,而不是一个样本得到一个PD)构建神经网络计算图的VR过滤。

在这里插入图片描述

这篇论文看到这里目前还是并没有任何创新,直接用了 [49] S. Zheng, Y. Zhang, H. Wagner, M. Goswami, and C. Chen. Topological detection of trojaned neural networks. In Proceedings ofthe Advances in Neural Information Processing Systems (NeurIPS), pages 17258–17272,2021. 中的方法。但是他这个整个应用的case和观察到的结果还是很有意思的。

case1

不可学习样本的目标是通过在共享之前向用户数据添加不可察觉的扰动来被动防止这种滥用。这种扰动应该足够强大,以防止任何DNN从其底层数据中学习有意义的模式,但又足够不可察觉,以不妨碍数据与其受众共享的效用。

构建这种数据保护扰动的方法有多种 [21, 48, 10, 11, 47, 34]。一般来说,所有这些不同方法的目标是为每个训练数据点 x_i
,找到一组扰动 δ ,使得在对扰动数据优化神经网络权重后,训练后的网络在测试集上产生高错误率。我们可以使用我们的符号表示这个目标为:
在这里插入图片描述
与我们的分析密切相关的一种方法是Yu等人 [47] 提出的。他们认为,大多数现有的不可学习样本在训练过程中在神经网络中创建了捷径路径 [47, 35]。因此,扰动生成过程可能会被过度简化,甚至一组线性可分的噪声数据也可以作为不可学习的扰动 [47]。因此,由于不可学习样本与神经网络中的捷径学习相关,它们可以成为我们分析的一个有趣案例研究。

实验设置
为了实证验证我们关于不可学习数据集训练的DNNs中存在拓扑特征的推测,我们选择了六种用于生成不可学习扰动的最新方法。这些方法包括目标性对抗性投毒(TAP)[10]、最小化误差噪声(EMN)[21]、鲁棒EMN(REM)[11]、神经切线泛化攻击(NTGA)[48]、捷径攻击(SHR)[13]和自回归攻击(AR)[34]。利用这些方法,我们创建了不可学习的CIFAR-10 [23]数据集,并在每个数据集上独立训练了70个ResNet-18 [16]模型。此外,我们还在干净版本的CIFAR-10数据集上训练了70个ResNet-18模型。我们使用Huang等人 [21] 中的设置来训练我们的模型。

评估
在训练每个模型直至收敛后,我们使用第3节中概述的框架提取DNN计算图的拓扑特征。我们使用ripser包 [41],通过VR过滤获得计算图的1维持久图(PD)。然后,我们对这个PD进行统计分析,以评估拓扑特征。为此,我们使用PD的平均寿命/持久性(AVG PD1)以及一对PD之间的Wasserstein距离(WSD)作为评估指标 [40]。

发现

  • 如图4所示,与干净模型相比,不可学习数据集训练的模型表现出不同的平均持久性。对于所有测试的不可学习模型,这种差异在统计上是显著的,报告的p值几乎为零。这一结果表明,在拓扑特征上,良性模型和不可学习模型之间存在明显的区分因素,表明不可学习数据集在DNN中为处理输入创建了替代路径。这些路径具有更高的寿命,表明模型在使用它们时过度自信
  • 从图5中可以看出,每个模型中持久性较高的环表明不可学习模型阻断了来自干净测试输入的信息流。因此,与干净模型相比,不可学习数据集训练的模型确实应该表现出较低的准确率。 这一观察可以通过查看ResNet-18模型对样本输入的特征图来验证。如图6所示,在不可学习模型的中间层中,我们看不到输入的任何痕迹,而这些信息很容易传递到干净DNN的更深层。
  • Sandoval-Segura等人 [35] 认为,即使不可学习模型也能够捕获可用于更好分类的有用特征。为此,他们使用简单的线性分类器在这些模型的冻结特征提取器上进行训练,并使用一个小的验证集。Kirichenko等人 [22] 之前已经表明,这种方法对于对抗虚假相关性是有效的。使用相同的方法,我们为所有模型训练了一个线性分类器头部,以获得线性探针准确率(LP ACC)。我们还计算了每个模型的PD与随机采样的干净模型之间的Wasserstein距离。如图7所示,不可学习数据集的强度与其在DNN中创建替代路径的能力之间存在对应关系。特别是,更高的Wasserstein距离表明训练模型的路径与基线干净模型的差异更大。因此,具有更高Wasserstein距离的模型倾向于具有更低的LP准确率,这表明底层不可学习数据集更具弹性。

在这里插入图片描述
在这里插入图片描述

在这里插入图片描述

case2

捷径学习的另一个有趣案例发生在训练有偏见的神经网络时。众所周知,偏见通常发生在模型专注于一个或一组敏感属性以做出最终预测,而忽略其余输入特征时。以贷款审批应用为例,在这种情况下,当模型特别关注某个敏感属性(如邮政编码)来决定是否批准贷款申请时,就会出现偏见。尽管这个概念很容易理解,但通常很难追踪机器学习模型(尤其是视觉领域的DNN模型)内部是如何处理特征的。

我们可以在神经网络的偏见和公平性问题中看到捷径学习的痕迹。回到我们的贷款审批示例,我们可以看到邮政编码可以作为一个虚假特征:当某些敏感的邮政编码作为输入出现时,神经网络内部存在一个捷径会被激活。对于这些邮政编码,模型忽略了其余的输入特征并输出负面决策。尽管这个问题与前面的案例研究相当不同,但我们证明,通过持久同调的视角可以做出类似的观察。

实验设置
为了进行实证研究,我们使用Seo等人的最新方法在CelebA数据集上学习无偏见的ResNet-18模型。以性别作为敏感属性,我们训练DNN模型来预测各种目标属性,如金色头发、苍白皮肤等。这些属性的分布自然会根据主题的性别而倾斜。例如,CelebA数据集包含的金发女性数量比男性多,这使其成为研究DNN公平性的绝佳数据集。对于每个目标属性,我们训练了10个常规(有偏见)和公平(无偏见)模型。唯一的例外是“金色头发”,我们为该属性训练了100个模型。

评估
为了定量评估每种情况下的偏见,我们使用常见的性能指标,如无偏见准确率、最差群体准确率、群体间无偏见准确率的标准差、等化机会(EO)和平均机会(AO)。此外,我们使用第3节中概述的框架计算每个模型的拓扑特征。特别是,我们计算模型的1维持久图并获得前5个最持久特征的平均值。

发现

  • 如图8所示,有偏见的模型比无偏见的模型表现出更高的1维持久性。这可能是由于有偏见的模型在DNN内部创建的捷径轨迹存在差异。再次强调,这种差异在统计上是显著的,足以区分无偏见和有偏见的模型。
  • 从图9可以看出,具有更高前5个持久性的模型更有可能是有偏见的。这也可以从这些模型的最差群体准确率中看出,它们明显低于无偏见的模型。
  • 在表1中,我们为CelebA数据集的10个目标属性提供了有偏见和无偏见模型之间的定量比较。如图所示,所有无偏见模型的前5个持久性都低于其有偏见的对应模型。有趣的是,较低的前5个持久性表明敏感群体间无偏见准确率的标准差较低。因此,DNN模型内部存在一个拓扑特征,表明它们是有偏见的还是无偏见的

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

结论与未来方向

我们证明了输入通过神经网络的路径包含了关于模型内捷径的宝贵信息。为此,我们使用了DNN中捷径学习的两个新案例:不可学习样本和公平性。我们看到持久同调在揭示神经网络内的这些失败案例中可以发挥重要作用。有趣的是,我们证明了这些差异在统计上是显著的。

尽管我们使用了这两个特定的案例研究,但持久同调在这些失败案例中的应用并不限于这些案例。以前,基于PH的解决方案已被独立发现用于与捷径学习相关的其他神经网络失败,如后门攻击、对抗性示例[12,14]和分布外检测。在本文中,我们的目标是论证所有这些解决方案可以结合在一起,以更广泛的层面缓解捷径学习。这是因为大多数DNN问题的原因都在于捷径学习,这可以通过探索计算图的路径来追踪。下面,我们强调一些有趣且具有挑战性的未来方向:

  • 使用持久同调创建强大的不可学习数据集:如图7所示,最具弹性的不可学习样本是那些与干净模型的常规路径偏差最大的样本。提出一个反映这种现象的新不可学习样本生成目标,可能会导致更好的不可学习样本。
  • 提出基于持久同调的新公平性度量:如表1所示,基于PH的度量(如前5个最持久特征)倾向于揭示DNN模型中的偏见。然而,这些原始度量并未校准:尽管它们的相对大小可能是偏见的指示,但我们不能直接基于这一度量比较不同模型。引入一个使用持久同调的新校准公平性度量,可能有助于更好地、更普遍地量化DNN模型中的公平性。
  • 在决策中纳入拓扑度量:从更广泛的意义上说,使用拓扑度量量化不确定性可能成为使用DNN进行决策的基石。这是因为表面上正常的模型应该引导输入在网络内沿着某些路径前进,因此,提出一个新的度量来涵盖这一点,可以帮助我们以一种直接的方式检测神经网络内的问题。这种解决方案也具有可解释性的潜力,因为它们可以揭示推理过程中涉及给定输入的路径。
  • 引入DNN训练的通用正则化器:一旦我们可以量化一个通用的不确定性度量,我们就可以潜在地使用这些度量来在神经网络计算图内强制执行某些行为。不幸的是,现有的在神经网络训练期间整合拓扑度量的工具在计算速度方面落后于其对应物,使其难以用于大规模模型。
  • 在不同的捷径学习场景下测试解决方案:最后,我们鼓励这一领域的研究人员不仅针对特定类型的捷径测试他们的解决方案,而是针对广泛的捷径类型进行测试。沿着这条线创建一个标准基准可以帮助研究人员思考捷径学习的更广泛问题,而不是专注于特定用例。

额外案例研究:后门攻击

后门攻击 [15] 是一类数据投毒攻击,攻击者通过投毒训练数据在模型中植入后门。这通常是通过在某些训练数据上附加特定的触发器来实现的。攻击者的目的是确保中毒模型在正常输入下表现正常,但在触发器被激活时输出其预期结果。已经有许多后门攻击被提出,例如BadNets [15]、Blended [7]、PhysicalBA [26]、标签一致性(LC)[42]、反射后门(Refool)[28]、ISSBA [25]、输入感知动态后门(IAD)[30]和WaNet [31],这些攻击旨在创建强大且隐蔽的后门以对抗神经网络。
人们普遍认为,后门攻击也在神经网络中创建了一个捷径,当输入包含触发器时,这个捷径就会被激活。Zheng等人 [49] 利用这一非正式的信念,设计了一个拓扑特征提取器来检测中毒模型与良性模型的区别。在本节中,我们将对不可学习数据集的统计分析扩展到后门攻击。为此,我们使用BackdoorBox [27]库,并在CIFAR-10数据集上为每种先前提到的后门攻击以及干净数据训练了70个ResNet-18模型。然后,我们使用Zheng等人 [49]提出的相同拓扑框架来提取训练模型的拓扑特征。
表3和图10总结了我们对后门攻击的实验结果。与前面的两个案例研究类似,我们看到几乎所有后门攻击都在神经网络路径中留下了拓扑特征,而持久同调可以揭示它们。与另外两个案例类似,如果我们能够为神经网络设计一个可微分的拓扑正则化器,我们也许能够缓解后门攻击。正如我们所见,对于所有三个案例研究,可以应用相同的拓扑工具。这是因为所有这些问题的根本原因都可以追溯到捷径学习,这是神经网络中的一种恶意行为。

在这里插入图片描述
在这里插入图片描述

Logo

脑启社区是一个专注类脑智能领域的开发者社区。欢迎加入社区,共建类脑智能生态。社区为开发者提供了丰富的开源类脑工具软件、类脑算法模型及数据集、类脑知识库、类脑技术培训课程以及类脑应用案例等资源。

更多推荐