2026/8/26 20:07:34

当AI解释被“欺骗“:XAI系统对抗攻击原理与防御思路(XAI-papers深度解读)

当AI解释被“欺骗“:XAI系统对抗攻击原理与防御思路(XAI-papers深度解读) 当AI解释被欺骗XAI系统对抗攻击原理与防御思路XAI-papers深度解读【免费下载链接】XAI-papers项目地址: https://gitcode.com/gh_mirrors/xa/XAI-papersXAI-papers 是一个持续更新的可解释AIXAI论文集合系统整理了如何理解、解释和可视化已训练机器学习模型的文献。本文以该集合为导读深入讲解XAI系统对抗攻击原理与防御思路攻击者可能让模型给出错误答案的同时让它的解释看起来依然可信——这正是我们建立可信解释必须解决的问题。 先认识XAI-papers 集合的结构这个开源项目把可解释AI领域的重要文献集中在一份README.md中按字母章节组织非常适合当攻击与防御方向的索引地图章节主题位置A解释模型内部机制特征可视化、网络反演、知识蒸馏、TCAV 等README.md#L51-L107B解释模型决策归因热图、注意力解释、评估方法、XAI对抗攻击README.md#L109-L272C反事实解释CounterfactualREADME.md#L274-L283D / E真实世界应用医疗等与人机协作README.md#L285-L295F其他方向README.md#L297-L302 理解XAI系统如何被攻击重点阅读 B1.2注意力解释、B1.4归因热图评估与 B2.5对XAI系统的对抗攻击三节。⚠️ 攻击原理解释是如何被欺骗的1. 注意力图不等于解释可被训练出来的假证据很多人把 Transformer 的注意力热图当作模型在关注哪里的解释。但 Pruthi 等人ACL 2020的《Learning to Deceive with Attention-Based Explanations》证明即使攻击者只有黑盒访问权限也能微调模型让注意力图指向攻击者想要的区域从而骗过依赖注意力图做审核的人。这与 Jain WallaceNAACL 2019《Attention is not Explanation》的质疑一脉相承。 见README.md#L164-L175B1.2 节。2. 对抗样本同时骗过模型和它的解释核心思路是给输入加入人眼难以察觉的微小扰动 ε模型的预测被翻转成攻击者指定的错误类别模型生成的归因热图仍高亮看起来合理的区域人工审核者看到合理的解释便放行攻击成功。Vadilo 等人2021的《When and How to Fool Explainable Models (and Humans) with Adversarial Examples》给出了完整框架场景 × 假设 × 人在环系统回答了何时、如何用对抗样本同时骗过可解释模型与人类。 见README.md#L262-L265B2.5 节。3. 解释本身可能撒谎不稳定与敏感性敏感性Yeh 等人2019《On the (In)fidelity and Sensitivity for Explanations》指出输入轻微扰动就可能导致解释剧烈变化README.md#L208-L211sanity checksAdebayo 等人NeurIPS 2018提出输入洗牌检验——若打乱输入后解释不变说明解释方法根本没在看输入README.md#L198可证伪性Leavitt Morcos2020《Towards falsifiable interpretability research》主张一个解释方法若无法被受控实验证伪其结论都不可信。README.md#L34-L37Opinions 节️ 防御思路四条防线建立可信解释防线核心问题代表方法详见集合1️⃣ Sanity Check解释方法活着吗Sanity Checks for Saliency MapsREADME.md#L1982️⃣ 系统化评估能否稳定定位关键区域ROAR、Deletion/Insertion、DiffROAR、ROADREADME.md#L193-L2003️⃣ 人在环验证解释真的提升了人类决策吗Debugging TestsAdebayo, NeurIPS 2020README.md#L202-L2054️⃣ 可解释性设计训练时就约束解释质量Right for the Right Reasons 等归因正则化B2.1README.md#L242-L246补充两点治本思路对抗鲁棒训练Chen、Agarwal、Nguyen2020发现经过对抗训练的神经网络行为更简单、泛化更好从源头降低可攻击性README.md#L98按设计可解释原型解释ProtoPNet 系列README.md#L251-L255、检索式解释 EMD-Corr能提升 OOD 鲁棒性README.md#L258-L259以及自解释网络 SENNREADME.md#L272。 别忘了XAI系统里的人也是攻击面Nguyen 等人2021发现图像分类任务中归因热图对人类-AI 协作的提升不如一个简单的最近邻示例解释且热图有效性与其定位指标并不相关——评估必须把人类纳入实验Fok Weld2023进一步指出解释很少带来互补表现可验证性才是关键。README.md#L203-L205NIST2021《Four principles of Explainable Artificial Intelligence》给出总纲解释必须对用户有意义、可理解、准确且AI 必须知道自己不知道什么Rudin 等人Nature 2019更激进高风险决策场景应直接改用可解释模型而不是给黑盒打补丁。README.md#L34-L37 新手速通指南4步读透XAI攻防文献获取集合git clone https://gitcode.com/gh_mirrors/xa/XAI-papers先读综述Gilpin 等人2019《Explaining Explanations: An Overview of Interpretability of Machine Learning》建立整体地图README.md#L30按攻防顺序精读B1.2 注意力欺骗 → B1.4 sanity checks 与 ROAR 评估 → B2.5 XAI系统对抗攻击README.md#L164-L175、#L191-L224、#L262-L265进阶方向Rudin 等人2021《10 Grand Challenges》看领域公认的开放难题README.md#L40-L41一句话总结XAI 系统的对抗攻击提醒我们——解释不是模型的附属品而是安全系统的一部分。只有经过 sanity checks、系统化评估与人在环验证的解释才配得上可信二字。【免费下载链接】XAI-papers项目地址: https://gitcode.com/gh_mirrors/xa/XAI-papers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考