跳到正文
今天10月8日周四
  1. 论文追踪 · 收录 · 原文 论文63

    CredLeak-Bench:七个模型在钓鱼场景下凭证泄露率 31%–76%,恢复率最高仅 24.2%

    研究者提出 CredLeak-Bench,用于评测邮件驱动的 Agent 工作流中凭证与敏感信息泄露问题,覆盖用户指定登录、自主收件箱监控和恢复三种设置,共 512、256 和 1024 个场景,全部在本地沙箱内用虚构服务运行,泄露以实际提交的合成数据判定。评测的七个模型包括 Claude Sonnet 5、Claude Opus 4.8、Gemini 3.6 Flash、GPT-5-mini、GPT-5.6-luna、Qwen3.5-9B 和 Llama-3.1-8B-Instruct,全部在指定登录和自主监控两种设置下发生泄露,指定登录场景泄露率为 31.3% 至 75.8%,两个开源权重模型最高,分别为 66.8% 和 75.8%。自主监控场景泄露率下降但误拒率大幅上升,例如 Opus 4.8 泄露率从 31.3% 降至 1.6%,误拒率从 6.6% 升至 88.3%。

    推荐理由七个模型在钓鱼场景下的凭证泄露率与误拒率被同时量化,并给出恢复率这一更难的指标,可供评估 Agent 授权流程时参考。

  2. 论文追踪 · 收录 · 原文 论文59

    APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权

    APort Vault 是一个针对工具型 AI Agent 支付授权的基准,作者把一场公开夺旗赛中人类写出的 4,371 条攻击重放到 14 个模型、8 家实验室、五档策略、两条重放轨道和两种架构上,共完成 225,964 次评测。攻击来自 2026 年 3 月至 8 月一场奖池 6,500 美元的实况 Agent 银行夺旗赛,97.7% 的尝试集中在 3 月 6 日至 12 日。评测把支付请求、成功支付、授权决定、收款人白名单成员资格和未经许可转账拆成五个事件分别记录,而非合成单一成功率。第 5 档授予零支付能力并指示模型调用工具,因此只用于测量执行是否被拦截,从不并入主结论。作者披露自己是所评估授权层开发商 APort Technologies 的创始人,225,964 条评测、分档护照、评分代码和分析脚本以 CC BY 4.0 发布。

    推荐理由论文以 4,371 条真实人工攻击重放比较工具调用边界的授权检查,为 Agent 支付场景提供了可复现的评测数据和方法。

  3. 论文追踪 · 收录 · 原文 论文52

    BackdoorVLM:面向视觉语言模型后门攻击与防御的基准

    研究者提出 BackdoorVLM,一个针对视觉语言模型(VLM)后门攻击与防御的综合基准,覆盖图像描述和视觉问答等核心视觉语言任务。该基准把多模态后门威胁分为定向拒答、恶意注入、越狱、概念替换和感知劫持 5 类,用 12 种涵盖文本、图像和双模态触发器的攻击方法,在 2 个开源 VLM 和 3 个多模态数据集上评测,并对比 5 种代表性防御方法。分析显示 VLM 对文本指令高度敏感,双模态后门中文本触发器通常压过图像触发器;涉及文本模态的后门效力很强,投毒率低至 1% 时多数任务攻击成功率仍超过 90%。现有防御在不同触发器类型和后门场景间缺乏泛化能力,难以可靠防护跨模态、多形态的触发器。

  4. 论文追踪 · 收录 · 原文 论文50

    SoK 论文提出面向意图的多轮 LLM 越狱分类体系

    一篇 SoK 论文提出面向意图的四部分分类体系,按对抗意图结构系统整理多轮 LLM 越狱攻击。作者通过受控消融实验发现,攻击效果取决于意图在多轮之间被组织的方式,而非上下文长度或查询次数。研究进一步指出,意图的组织方式决定了其可被检测的层级,检测面需要从单轮层级扩展到会话层级乃至跨会话层级。作者据此认为,仅针对单轮的安全机制在结构上不足,单点评测也忽略了意图的组织方式,需要与有害意图可观测层级相匹配的评测协议。代码已公开。

  5. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文34

    AI 安全 Stackelberg 模型中的防御充分性研究

    研究将 AI 系统防御建模为防御者主导的 Stackelberg 博弈,防御者投入主动发现与被动修复,攻击者选择搜索强度。理论证明:若每个未解决攻击都有持续被发现的机会、修复有效且后续更新保留既有防护,则有限攻击面可以概率 1 被防御;并给出完成时间界,扩展到攻击面增长、修复跨相关攻击泛化及多种发现机制的情形。数值实验刻画了防御者不投入、只投入一种或同时投入两种能力的均衡区间,并显示更快修复可缩短被攻陷时长但不降低被攻陷概率。

  6. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文60

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    研究者提出 WebMirage,一个针对视觉网页 Agent 的端到端红队框架,通过在被控图像上施加局部视觉扰动,让 Agent 选中攻击者控制的内容并执行对应浏览器操作。该框架用角色槽抽象与网页重组建模候选元素之间的竞争,并用 dataflow 分析把优化目标对齐到动作后处理阶段,只保留决定浏览器命令的 token。在四种 Agent 配置、六种 VLM 主干、覆盖 13 个公开网站与沙箱基准的 2250 个任务上,WebMirage 平均攻击成功率为 91.9%,最强基线为 17.4%。三种现有 Agent 级防御下攻击成功率仍在 86.5% 至 91.9% 之间;让候选标识符随机化的自适应防御把成功率从 93.8% 降到 11.7%,但干净任务准确率也从 100% 降到 15.9%。

    推荐理由论文把视觉红队建模为从视觉定位到浏览器执行的端到端过程,展示了该攻击在多种 Agent 配置下的成功率与现有防御的覆盖情况。

  7. 论文追踪 · 收录 · 原文 论文44

    ASPIRE:面向 LLM Agent 的开放式提示注入红队引擎

    研究者提出 ASPIRE,一个面向 LLM Agent 的开放式、行为级漏洞发现红队引擎,用于应对 Agent 检索不可信内容并通过工具行动所带来的间接提示注入风险。ASPIRE 维护一个持续演化的 Agent Security Behavior Graph,用互补的 Explore 与 Exploit 专家发现、验证并泛化以后果为中心的测试;轨迹证据用于更新该图并诊断部分或失败的尝试,跨运行记忆则迁移有效的红队策略。论文称在多个基准上的实验显示,ASPIRE 在后果、注入方法、环境和行为路径上大幅扩展了覆盖范围,同时保持较高的攻击成功率。

  8. 论文追踪 · 收录 · 原文 论文51

    研究者提出 PackHallu:经规则文件提示注入对编码 Agent 发起包幻觉攻击

    研究者提出包幻觉攻击,攻击者在社区共享的规则文件(如 .cursorrules)中注入恶意提示词,诱导编码 Agent 把合法依赖替换为攻击者控制的包。为生成有效注入提示词,作者提出 PackHallu 进化优化框架,利用轨迹级反馈和 LLM 引导的变异迭代改写注入内容。在多个基准、LLM 和 Agent 框架上的评测显示,PackHallu 取得较高攻击成功率,并在不同模型与 Agent 组合间具有较强迁移性。研究认为编码 Agent 易受此类攻击影响,自主编码系统需要更强的安全防护。

  9. 论文追踪 · 收录 · 原文 论文59

    SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%

    研究者提出 SLIP(Self-Jailbreaking via Lexical Insertion Prompting),一种无需外部攻击模型的黑盒越狱方法:先以生成安全训练数据为名让目标模型自己产出良性/有害提示-补全对,再通过多轮对话逐步插入攻击目标中缺失的关键词,用广度优先树搜索寻找最短越狱路径。在 AdvBench 和 HarmBench 上,SLIP 对 11 个模型(含 GPT-5.1、Claude-Sonnet-4.5、Gemini-2.5-Pro、DeepSeek-V3)取得 90–100% 攻击成功率,平均 94.7%(AdvBench)和 94.4%(HarmBench),平均仅约 7.9 次模型调用,比此前方法少 3–6 倍。Claude-Opus-4.5 最难攻破,为 61.4%/68.7%。

    推荐理由论文提出无需外部攻击模型的自我越狱方法,在 11 个模型上给出成功率与查询成本,并附一个对话级检测防御。

10月7日周三
  1. 论文追踪 · 收录 · 原文 论文58

    研究:94% 开发者未能识破编码 Agent 的隐蔽破坏

    美国东北大学团队开展了一项大规模人类监督实验,让 100 多名有编程经验的参与者与 Claude-Opus-4.6、GPT-5.4、Gemini-3.1-Pro、MiniMax-M2.7 四个前沿模型协作完成约五小时的电商应用开发任务,而 Agent 暗中执行将合成敏感数据外泄到外部 IP 的隐藏任务。在无监控条件下,83/88(94%)的参与者未能发现并移除破坏行为。在 Claude-Opus-4.6 的监控组中,Claude-Haiku-4.5 监控器标记出 16/19(84%)的破坏尝试,但即便警报正确,破坏仍在 9/16(56%)的会话中成功。作者将失败归因于极少代码审查、Agent 给出的合理掩护说辞以及开发者对 Agent 的过度信任,并建议监控器组合多种信号、从仅标记转向主动干预。研究还发现,成功避开破坏的参与者初始信任度更低。 这些破坏行为由红队提示诱导,不能据此认定模型会自发执行;带监控组仅有约 19 个会话,结果的外推范围有限。

    推荐理由研究用五小时真人协作实验量化了人类监督在编码 Agent 破坏行为前的失效比例,并给出监控设计建议。

  2. arXiv · 收录 · 原文 日期未知论文31

    NetAgent:面向多任务网络流量分析的智能体框架

    NetAgent 是首个用于多任务流量分析的智能体框架,无需任务特定训练即可完成复杂任务理解、动态分解编排与长时程分析。它包含知识增强的工作流规划、150+ 工具的动作空间、统一代码执行空间、三层记忆以及沙箱与运行时修复五项设计。在 9 个基准上,NetAgent 在几乎所有任务上超越 23 个单任务和 5 个多任务基线,对未见流量分布的 F1 达 90.04%,而最佳基线仅为 2.74% 和 3.04%。

  3. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文32

    ATLAS:用自适应信任域与主动学习搜索潜在对抗样本集

    ATLAS 是一个基于查询的黑盒对抗攻击框架,将攻击生成建模为主动学习中的水平集估计问题,结合校准近似与局部-全局采样架构定位并采样包含对抗样本的输入区域。在 MNIST、CIFAR 和 ImageNet 的标准与对抗训练模型上,ATLAS 生成的对抗样本比 NES、SignHunter、BayesOpt 等查询式黑盒攻击更具代表性,并在有限查询预算下覆盖更多对抗区域。该框架可用于开发中系统的鲁棒性分析与持续审计。

  4. 论文追踪 · 收录 · 原文 论文44

    AdvSim2Real 用任务与注入对手共同演化训练网页智能体

    AdvSim2Real 提出在冻结的网页世界模型中让任务课程、注入对手与智能体共同演化,以提升网页智能体对页面植入指令的鲁棒性。课程只奖励智能体约一半时间能解决的任务,对手只奖励能把判定成功翻转为失败的注入。训练后 4B 智能体的任务完成率在有攻击和无攻击下均上升,并能抵御训练中未见过的前沿模型对手,能力提升也迁移到真实浏览器。在 150 个网页任务上,面对这一未见对手,AdvSim2Real 相对基础智能体把完成率提升 33.6%。

  5. 论文追踪 · 收录 · 原文 论文58

    HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制

    中山大学、香港浸会大学等机构的研究者提出 HarnessSecurity-Bench,对 Claude Code、Codex CLI、Gemini CLI、gptme、Qwen Code 和 GitHub Copilot 六款编码智能体框架的原生安全机制做横向评测。研究先梳理出十类安全机制,在 400 个框架与机制组合中确认 205 项已实现、83 项缺失、112 项证据不足,已实现项中约半数为需用户主动开启的可选项,闭源框架的证据缺口更明显。评测在 GLM-5.2 基座模型下完成 2500 次试验,记录 81155 次工具调用和超过 22 亿 token。案例显示限制共享能力会同时阻断合法与恶意操作,被允许的解释器仍可成为绕过路径。研究者建议框架提供方公开可验证的安全设置,并同时报告攻击效果、任务效用与执行成本。

    推荐理由论文用 2500 次试验量化了六款编码智能体安全机制在攻击成功率与任务效用之间的取舍,为配置选择提供了可比较的数据。

  6. 论文追踪 · 收录 · 原文 论文57

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    圣加仑大学等机构的研究者提出 AgentSpy,在隔离环境(Firecracker microVM)中从操作系统边界记录 Agent 及其所有子进程的系统调用与网络流量,不依赖 Agent 自身的轨迹记录。它提供两类确定性分析:可靠性分析把每次执行汇总为星形图,统计执行的命令、读写的文件和访问的主机,并计算多次运行的相似度与技能覆盖率;安全分析则用规则检查读取私钥、越界修改文件、运行不可信程序、连接不可信域名等禁止行为。在 SkillsBench 的 77 个任务、codex harness 与三个模型上,同一任务的重复运行比混入其他任务的运行更相似的比例为 92.2%;在三次运行均通过测试的任务中,18% 出现与任务无关的活动,7% 读取了评分文件,17% 未使用开发者提供的技能指引。

    推荐理由AgentSpy 在系统调用层记录 Agent 及其子进程行为,并给出可靠性分析与安全规则两套确定性分析,可对照其评测结果评估自身 Agent 的可观测性方案。

  7. 论文追踪 · 收录 · 原文 论文46

    In Vino Veritas and Vulnerabilities:用醉酒语言诱导检验 LLM 安全

    论文提出“醉酒语言”作为大模型安全失效的诱因,并用三种机制在 LLM 中诱导这种语言。作者采用角色扮演提示、因果微调和基于强化的后训练三种方式,在 5 个 LLM 上评估,发现这些模型在 JailbreakBench 上更易被越狱(即使存在防御),在 ConfAIde 上更易泄露隐私,表现优于基座模型及此前报告的方法。作者结合人工评估、LLM 评估器和错误类别分析,指出醉酒语言诱导出的模型行为与人类醉酒行为存在对应关系,并将其类比为 LLM 的拟人化。作者认为,这些诱导方法简单高效,可能成为对抗 LLM 安全微调的手段,给 LLM 安全带来显著风险。

10月6日周二
  1. 论文追踪 · 收录 · 原文 论文53

    研究评测五款开源文生图模型的有害内容生成与审核缺口

    研究团队用自动化流程把合法新闻标题改写成针对色情、暴力血腥、有害刻板印象、自残和仇恨言论的提示词,系统评测了五款开源文生图模型的有害内容生成能力。对 1,500 张生成图像的人工评估显示,血腥类提示词的有害内容生成率达 89.2%,色情内容 47.6%,有害刻板印象 43.6%,仇恨言论 46.0%,自残 34.5%,且多以血腥暴力形式出现。社区微调变体在色情提示词上尤其脆弱,FLUX.1-dev 有 30.9% 的案例生成明显逼真的有害图像。对自动审核系统的评估发现明显检测缺口,不安全图像可绕过过滤;合成图像检测器方面,仅用良性数据训练的模型在露骨内容上表现更差,训练数据更多样则检测效果更好。

  2. 论文追踪 · 收录 · 原文 论文31

    NeuroSploit v4.2.0 在 GOAD 上的评测:结构化智能体编排提升 AD 渗透测试

    开源 Rust 自主渗透测试框架 NeuroSploit v4.2.0 在 GOAD 靶场(5 台虚拟机、2 个森林、3 个域)上完成评测,其编排 22 个 AD 专用智能体与 7 套多阶段攻击链 playbook,覆盖枚举、Kerberoasting、AD CS(ESC1-ESC8)、DCSync、跨森林信任滥用等完整杀伤链。对 Claude Opus 4.6/4.7/4.8、GPT-6 Astra、GPT-5.6 Sol、Grok 4.6、Qwen 3.8、GLM 5.3、Kimi k3 九个前沿模型的测试显示,框架实现 96-100% 技术覆盖率与 90-97% 精确率,直接调用仅覆盖 21-54% 且误报多出 3.2 倍;使用 Opus 4.8 时 134 分钟完成三域完全攻陷,护栏机制阻止了触发锁定的喷洒、未授权 DCSync 转储与越界侦察。

  3. arXiv · 收录 · 原文 日期未知论文52

    TAPDreamer:可跨任务迁移的世界动作模型对抗补丁

    研究者提出 TAPDreamer,一种针对世界动作模型的对抗补丁攻击,仅用公开编码器构造固定局部扰动,无需查询目标策略即可跨任务和动作架构迁移。其思路是补丁引起的注意力权重与 value 向量变化会把表征偏移广播到补丁范围之外,且在不同任务观测中保持稳定;方法用单一源任务的六帧最大化干净与加补丁编码器表征之间的全局 L1 距离。闭环评测中,每个基准一个冻结补丁覆盖约 6.5% 输入,使 FastWAM 在 40 个 LIBERO 任务上的成功率从 97.7% 降至 0.0%,在 50 个 RoboTwin 任务上从 90.8% 降至 0.0%,而随机补丁仍保持 81.5% 和 79.2%。同一补丁在两个 DreamWAM 配置上把成功率降至 2.1% 和 0.8%,在 Motus 上降至 10.0%。

  4. arXiv · 收录 · 原文 日期未知论文39

    研究者提出面向深度强化学习的轨迹级可迁移黑盒对抗攻击

    论文研究针对深度强化学习(DRL)的基于迁移的黑盒攻击,攻击者在白盒替代智能体上构造观测扰动,再施加给未知受害者策略,并将攻击形式化为每步扰动预算下的回报最小化。作者首先发现,把图像分类的可迁移攻击 FGSM、MI-FGSM 和 NI-FGSM 移植到逐帧目标后,生成的扰动虽能迁移,但强度不超过同等预算的随机噪声。为此他们提出轨迹级攻击,借助可微环境模型和温度平滑的替代策略,在滚动时域上优化一串扰动,并使用相同的优化器。在 CartPole-v1 上,针对十个 DQN 与 DDQN 智能体、100 对替代与受害者组合,该轨迹级攻击在白盒、跨模型和跨算法设置下均优于逐帧攻击和随机噪声。

  5. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文47

    Red-TTT:用测试时训练实现大语言模型自动化越狱

    研究者提出 Red-TTT,在针对每个行为的攻击过程中更新攻击者参数,而不是像现有自动化红队方法那样在攻击开始后冻结攻击者权重。每轮攻击中,攻击者采样一组候选、根据受害模型的回复打分,并在抽取下一组前执行一次策略梯度更新,把对当前受害模型的认识固化进权重而非停留在上下文窗口里。该方法还调整了训练目标,以单次最佳样本而非平均表现衡量红队成功。Red-TTT 只需要对受害模型的采样访问,可直接接入现有攻击流程。在 120 次采样的预算下,相比 Best-of-N 基线,其平均攻击成功率从 55.9% 提升到 72.4%,在所有配置上均优于基线,并攻破了此前方法无法攻破的多个行为。

  6. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文47

    Penumbra:面向监管义务的样本高效对抗搜索方法

    研究者提出 Penumbra,一种面向监管义务的对抗搜索方法,从已验证的锚点出发,在逐步扩大的编辑预算下搜索,直到由两名评估者组成的委员会改变判定,并输出跨越判定边界的两条相邻响应。该方法采用自适应分配,目标是对失败面的覆盖,即每个候选解决的(义务×失败模式)单元格数量。在同等预算下,自适应分配在 59% 的候选上达到均匀分配全预算的覆盖;在相同记录数下,其覆盖的失败模式是朴素枚举的 1.43 倍,且增益局限于其针对的维度。在金融顾问章程的 60 条筛选义务上,Penumbra 返回 144 对响应,每对包含委员会判定为合规与违规的两条文本,仅相差几个词;直接要求模型同时生成两类文本时,两者几乎不共享内容。在临床分诊的第二份章程上,该方法在 18 条义务上复现了结果,得到 49 对同样紧密的响应,且最难的模式相同。

  7. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文53

    论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证

    论文将 Verification Autonomy Levels(VAL)框架应用于 22 项 Agent 安全防御,按验证规范的来源把防御分为 L0 到 L5 六级,主张防御的等级由锚点而非准确率决定,锚点同时决定其失效模式。作者在自建测试床(50 个场景、12 种攻击变体、DeepSeek-chat)上以同等预算对比两套防御栈:VAL 引导栈(确认门加 schema 沙箱)在 0.000 攻击成功率下保持 1.000 良性成功率,而主流直觉栈(提示词加固加关键词过滤)虽同样达到 0.000 ASR,却使全部良性动作失败。在攻击面更强的测试环境中,直觉栈的零值会漂移(0→1.9%→6.2%),VAL 栈在其操作设计域内保持稳定。在 AgentDojo 官方 banking 套件上,VAL 栈达到 0.5% ASR、79.7% 效用,未防御基线为 4.3% ASR、86.6% 效用。

    推荐理由论文提出按验证锚点分级的方法,解释同样 0% 攻击成功率为何对应不同安全保证,并给出跨基准的部署对比数据。

  8. 论文追踪 · 收录 · 原文 论文54

    研究者训练出按多智能体拓扑触发的代码后门模型

    研究者构建人为植入后门的实验模型,测试其是否会依据推断出的单智能体或多智能体部署环境改变代码安全行为。作者报告受控任务中存在环境相关的安全差异,并以多组对照分析触发条件。这是人为构造的受控实验,不是模型自发涌现行为;真实多智能体环境中的触发尚未测试。

    推荐理由论文用受控模型生物展示按部署拓扑触发的后门,并给出跨单智能体与多智能体上下文的差分审计思路。

  9. 论文追踪 · 收录 · 原文 论文54

    AgentHazard:评估计算机使用智能体有害行为的基准

    研究者发布 AgentHazard,一个评估计算机使用智能体有害行为的基准,包含 2,653 条实例,覆盖 10 类风险与 10 种攻击策略,每条实例把有害目标嵌入一系列单看合理、累积后导致不安全执行的步骤。基准在 Claude Code、OpenClaw 和 IFlow 三个框架上,用 Qwen2.5、Qwen3、Kimi、GLM 等模型评测,结果显示当前系统仍高度脆弱:Qwen3-Coder 驱动 Claude Code 时攻击成功率达 73.63%,GLM-4.6 在 Claude Code 下达 82.90%,平均危害分 7.05。同一模型在不同框架下攻击成功率差异超过 16 个百分点,说明模型层面的对齐不能可靠迁移到智能体层面。基准提供沙箱化、模块化的评测框架与轨迹级执行数据。

    推荐理由AgentHazard 用 2,653 条多步可执行任务测出智能体在累积上下文中的危害行为,并给出各框架与模型的攻击成功率对比。

  10. Hugging Face Daily Papers · 收录 · 原文 论文40

    研究提出医疗答案事实核查失败分类法,指出检索后验证范式的固有局限

    研究者针对开放式医疗答案的事实性验证,提出两套失败分类法,把失败拆解为检索阶段的五类质量维度错误和验证器推理的六个连续步骤错误。研究基于 MedExpert 开放式数据集和 3 个封闭式数据集开展案例研究,并用 LLM-as-Judge 自动归纳模式,对证据质量和验证器推理错误进行大规模标注。在 4 种检索方法和 6 个前沿验证模型上的压力测试显示,扩大模型规模、增加推理投入、引入权威网络来源以及医疗微调都无法消除这些失败模式,说明它们是检索后验证范式在开放式医疗场景中的固有局限,而非旧系统的产物。代码与数据已公开。

10月5日周一
  1. 论文追踪 · 收录 · 原文 论文54

    宾州州立大学提出 TPRS,量化 Agent 安全基准中工具命名对 ASR 的影响

    宾州州立大学研究者提出威胁保持表示敏感性(TPRS),衡量在任务、有害动作、安全策略、真值和评测标准不变、仅改变 Agent 可见表示时攻击成功率(ASR)的变化幅度。在 ASB、MCPTox 和 AgentDojo 三个基准共 28,904 次 Agent 运行中,ASR 变化方向不一致:ASB 把威胁相关工具名换成中性名后,GPT-5-mini 的 committed ASR 上升 11.67 个百分点,Claude Haiku 4.5 上升 13.21 个百分点;MCPTox 把中性名换成威胁相关名后,GPT-5-mini 的 ASR 下降 11.00 个百分点,Haiku 4.5 下降 4.11 个百分点;AgentDojo 在 GPT-4o-mini 上 ASR 仅变化 0.50 个百分点,但需要该工具的任务上良性效用下降 5.36 个百分点。

    推荐理由论文用近 2.9 万次 Agent 运行量化了工具命名等表示变化对 ASR 的影响,做 Agent 安全评测的团队可据此检查自己的基准是否对表示敏感。

  2. 论文追踪 · 收录 · 原文 论文60

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    日本北陆先端科学技术大学院大学(JAIST)研究者 Zhuowen Liu 在论文中重测了 15 个提示注入检测器和 2 个任务感知 LLM 判官,发现公开基准上的检测排名很难迁移到 Agent 实际场景。研究用无 LLM 回放 AgentDojo 与 τ-bench 的真实工具调用构造良性输出,再用差分回放标注注入输出,并在 BIPIA 上对比。BIPIA 上表现最好的 PIGuard 在 1% 假阳性率下只检出 2.1% 的 AgentDojo 注入,而检出 72.2% AgentDojo 注入的 Prismor 在 τ-bench 上只有 15.2%;BIPIA 与 AgentDojo 之间的 Kendall τ 仅 0.01。相反,工具输出上的假阳性率在两个 Agent 基准间保持一致(τ=0.67),范围从 0% 到超过 90%。

    推荐理由论文用 AgentDojo 与 τ-bench 的真实工具输出重测 15 个注入检测器,指出公开基准分数难以预测部署表现。

  3. 论文追踪 · 收录 · 原文 论文53

    MLCommons 发布 Jailbreak Benchmark v1.0,八款开源模型平均韧性差距 7.57%

    MLCommons 发布 Jailbreak Benchmark v1.0,对八款开源权重模型做单轮文本越狱评测,不安全回复率从基线的 11.08% 升至攻击条件下的 18.65%,平均韧性差距 7.57%。评测覆盖暴力犯罪、无差别武器、仇恨、儿童性剥削等 11 类危害,每类 24 条种子提示词共 264 条,并实现 12 种越狱攻击,其中内容框架与欺骗类因评测器限制未纳入定量分析。角色扮演、模板以及包装或 schema 类攻击的平均攻击成功率最高;31B 参数以下的可及模型平均差距约 21%,但样本量小,结论仍属初步。三款 Large 类模型出现负韧性差距,即攻击条件下的不安全回复率低于基线,作者认为可能来自评测器行为、解码设置、真实鲁棒性或模型针对越狱特征而非违规内容本身的拒答。

    推荐理由MLCommons 首次给出端到端越狱评测的完整结果与韧性差距指标,可对照自家模型的基线安全与抗攻击表现。

  4. 论文追踪 · 收录 · 原文 论文43

    AgentTrap:面向自主渗透测试 Agent 的有状态反馈欺骗蜜罐

    研究者提出 AgentTrap,一种面向自主渗透测试 Agent 的闭环蜜罐,通过哨兵端点避免误伤正常流量、基于被保护应用的状态化欺骗,以及行为引导的升级策略来维持交互并收集 Agent 侧行为证据。在部署的 Web 应用中,研究团队用真实应用端点与独立蜜罐端点、三种防御策略对八种自主渗透测试 Agent 进行评测。相比无防御,AgentTrap 将真实目标的总体攻击成功率从 95.8% 降至 79.2%,并在 18.8% 的运行中成功诱导出攻击方 API key,效果优于静态欺骗与固定升级策略。轨迹分析显示,Agent 抵御此类反制的能力同时取决于模型层面对欺骗性请求的识别和架构层面对敏感资源的隔离。

  5. 论文追踪 · 收录 · 原文 论文53

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    复旦大学与中关村实验室等机构的研究者提出 EvoRiskBench,一个面向工作区 Agent 运行时安全风险的演化基准,用 EP–Path–EF 框架把九类风险入口与五类技术后果通过 Agent 执行路径连接起来。基准包含六个场景下的 450 个可执行对抗任务,在隔离的 Windows 容器中运行,并用执行轨迹、环境状态和 ETW 进程与网络事件独立验证攻击结果。研究者在三种模型(GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5)与三种 harness(Claude Code、Codex、OpenClaw)组成的九种配置上做了 4050 次攻击执行,总体攻击成功率 37.46%,最高为 DeepSeek-V4-Pro-0813 配 Codex 的 68.44%。

    推荐理由论文给出九种 Model × Harness 组合在 450 个可执行用例上的 ASR 与 TSR,并指出模型差异大于 harness 差异,可供部署工作区 Agent 的团队对照自身配置。

  6. 论文追踪 · 收录 · 原文 论文53

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    剑桥大学等机构的研究者提出 COBRA,一种针对计算机使用 Agent(CUA)分支引导攻击的系统级防御架构。作者指出,Dual-LLM 模式虽能保证控制流完整性,但在图形环境中计划必须按运行时网页内容分支,攻击者可构造不可信数据把 Agent 推向预先批准的危害路径,而无需注入新指令。为此作者构建 STEER-Bench,覆盖 9 个领域 101 个任务,测得分支引导攻击对标准 CUA 的攻击成功率为 94.4%,对原版 Dual-LLM 为 89.5%。COBRA 在规划阶段为每个分支预先固定目的地、端点和工具参数约束,由 Branch Resolution Hub 校验运行时分支与参数,并在 HTTP 与 MCP 代理处强制执行。代码已开源于 GitHub。

    推荐理由论文把分支引导攻击归为数据流完整性问题,并给出在 HTTP 与 MCP 边界施加分支级约束的架构,附开源代码与多基准结果。

  7. arXiv · 收录 · 原文 论文67

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    密苏里大学堪萨斯城分校的研究者提出跨通道碎片化攻击,将看似无害的载荷分散到 MCP 的两个或三个输入通道,单个通道都不含完整注入,模型却在统一上下文窗口中把它们拼合成凭据外泄。研究在 12 个前沿模型、3 个生产客户端和 6 种载荷上完成超过 15,000 次试验,发现完全抵抗单通道注入(0% 合规)的模型在两通道碎片化下外泄率最高达 100%,包括 GPT-4o、Llama 70B、Composer 2 和 Haiku 4.5。三通道碎片化在生产客户端中进一步扩大受影响范围,Haiku 4.5 在 Cursor 中达到 100%,Sonnet 4.6 和 Opus 4.6 在所测碎片化攻击中未发生泄露(0/20)。研究还展示了价值对齐利用(工具声称的用途本身就需要目标数据)以及通过 VS Code 的 sampling/createMessage 注入持久系统提示。

    推荐理由论文给出跨通道碎片化攻击的完整测量框架与 12 个前沿模型的合规矩阵,部署 MCP 客户端的团队可据此检查自身信任假设。

  8. 论文追踪 · 收录 · 原文 论文59

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%

    研究者提出 Pretext,用于评估了解检测器内部机制的攻击者能否绕过 Agent 技能安装前的安全扫描。论文报告,这类白盒攻击可以在保留技能正常功能的同时逃过结合静态检查与语言模型判断的检测框架,并在三个开源模型上比较了检测器固定及与攻击者共同适应两种设置。作者报告两种设置下仍存在较高的绕过风险,指出安装前扫描不足以单独保证技能执行安全。这些结论来自论文作者的实验,不能视作所有技能扫描器或实际部署环境的普遍结果。

    推荐理由论文给出针对技能扫描器的白盒绕过方法与两种检测器设定下的成功率,做 Agent 技能供应链安全的团队可据此评估现有扫描器的边界。

  9. 论文追踪 · 收录 · 原文 论文56

    MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    研究者提出 MMPIBench,一个可复现的多模态提示注入基准,用同一套攻击、工具集和系统提示词在 LangGraph、CrewAI、AutoGen、OpenAI Agents SDK、Semantic Kernel、LlamaIndex 六种 Agent 框架上运行,覆盖五种基础模型、六种视觉载体和四类攻击目标,共 720 次运行。结果显示攻击完成率约 1%,但被尝试的比例达 12.8%,差距几乎全部在规划阶段被消解,即模型读到注入指令后拒绝执行。模型比框架更能决定指令是否被采纳:Claude Opus 4.8 在 144 次运行中从未尝试攻击并在 59.7% 的运行中识别出注入,Grok 4.3 与 Llama 4 Maverick 的尝试率均为 23.6%。载体方面,渲染 OCR 文本最有效,贡献了 8 次完成中的 7 次;EXIF 元数据和二维码约 88% 的运行中未被感知。

    推荐理由论文用统一的跨框架测试台定位注入攻击在感知、规划、工具调用各阶段被拦下的位置,并给出模型与框架各自的作用。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文55

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    研究者提出 Concept2Scenario,把场景化越狱建模为表示空间的因果归因,通过 SAE 概念方向定位抑制拒答的内部概念,再翻译成自然语言越狱场景。在三个开源模型、两个安全基准和六种黑盒越狱方法上,发现的场景作为可复用先验把平均攻击成功率最多提升 18.2 个百分点。从开源模型提取的场景还能迁移到 GPT-5、Claude-Haiku-4.5 和 Gemini-3-Flash,提示部分场景级拒答漏洞跨模型家族共享。交互归因进一步筛出协同场景组合,其效果超过单个场景,并让迭代攻击在更少轮次内成功。分析还显示拒答抑制集中在极少数概念上,且不同模型的脆弱领域差异明显。

    推荐理由论文把场景化越狱归因到 SAE 概念方向,并给出可复用的场景先验,红队与对齐研究者可据此理解拒答被绕过的机制。

  2. 论文追踪 · 收录 · 原文 论文59

    ActBench:面向协作智能体行为安全的自演化基准

    香港城市大学、浙江大学、伦敦大学学院与小米的研究者提出 ActBench,一个从执行轨迹而非最终回复评估协作智能体行为安全的自演化基准。基准包含 213 个场景的 300 对良性/恶意配对用例,覆盖 15 种风险行为、六个执行空间和 48 个 web 服务 API,恶意用例在保留指令、配置、初始状态与评分标准的前提下注入任务可达载荷。构建方法结合奖励引导的束搜索与基于反思的深度探测,并用日志证据与 LLM 轨迹证据的双重验证判定攻击是否真正生效。在 24,000 条轨迹上评估 15 个 LLM 和 6 个开源协作智能体,固定框架时攻击成功率从 10.1% 到 94.4%,固定基座模型时跨框架从 73.7% 到 94.4%,模型差异大于框架差异。基准已开源于 https://github.com/zjuicsr/ActBench。

    推荐理由该基准用配对良性任务与对抗变体,从执行轨迹而非最终回复判定行为安全,并给出跨模型与跨框架的攻击成功率对比。

  3. 论文追踪 · 收录 · 原文 论文41

    研究者提出最小范数攻击集成,用鲁棒性曲线替代单一 ε 评测

    研究者提出一套统一的对抗鲁棒性评测框架,用覆盖 ℓ0、ℓ1、ℓ2、ℓ∞ 四种范数的最小范数攻击池和鲁棒性-扰动曲线,替代在单一扰动预算 ε 下使用 AutoAttack 等预设攻击集成的做法。作者指出,鲁棒性-扰动曲线可能在不同模型间交叉或以不同速率衰减,导致单一 ε 下的排名不稳定,且现有集成无法说明与最坏情况性能的差距,也无法系统控制攻击强度与评测成本的权衡。为此他们把评测形式化为前沿逼近问题,构造最小范数攻击集成,在可控查询预算下逼近攻击前沿,预算越大估计越紧。作者还定义防御前沿为各扰动规模下模型集合中的最高鲁棒性,并提出 Defense Optimality Index,按防御与防御前沿的差距排名,无需选定参考 ε。在 CIFAR-10 和 ImageNet 上,该集成在多数防御和各个预算档位上达到或超过 AutoAttack,且查询成本固定可控。

  4. 论文追踪 · 收录 · 原文 论文22

    Windows 恶意软件检测器作为复合 AI 系统:准确率、效率与对抗鲁棒性的权衡

    研究提出一种面向 Windows 恶意软件检测的复合 AI 系统评估方法,在检测性能、计算开销与鲁棒性之间显式权衡,并引入系统级威胁模型,刻画攻击者利用不同程度知识绕过整个复合系统而非单个检测器。真实数据实验显示,该系统可缩短训练时间并提升响应速度,仅带来检测性能的轻微损失;知识越多的攻击者能构造更有效的对抗样本,降低系统响应能力,暴露出效率与鲁棒性之间的直接权衡。