2026/8/18 14:32:04

Immunity memory-based jailbreak detection: multi-agent adaptive guard for large language models

Immunity memory-based jailbreak detection: multi-agent adaptive guard for large language models 文章总结与翻译一、主要内容该文章针对大型语言模型(LLMs)面临的越狱攻击威胁,提出了一种基于免疫记忆机制的多智能体自适应防护框架(MAAG),用于高效检测恶意越狱提示。核心背景LLMs在AI系统中应用广泛,但易受精心设计的越狱攻击绕过安全护栏,生成有害内容,因此检测此类恶意输入至关重要。现有越狱检测方法多依赖静态训练数据或预定义攻击模式,存在适应性差、更新成本高、难以应对新型攻击等问题。框架结构MAAG包含三个核心阶段,形成动态防护闭环:免疫检测阶段:提取输入提示的隐藏层激活值,与记忆库中存储的历史攻击和良性样本激活值进行余弦相似度匹配,通过Top-K采样和层间判别分析快速完成初步检测。响应模拟阶段:部署双智能体系统,响应智能体基于检测结果生成候选响应,反思智能体监督响应过程并验证检测正确性,弥补单纯依赖隐藏状态匹配的局限性。记忆更新阶段:将检测结果(含隐藏状态和模拟响应)存入记忆库,区分短期和长期记忆,实现对新型攻击模式的持续学习,动态优化检测能力。实验与效果在5个开源模型(Mistral-7B、Vicuna-7B/13B、Llama2-7B、Llama3-8B)和6种主流越狱攻击场景下进行测试。