跳到正文
今天10月8日周四
  1. 论文追踪 · 收录 · 原文 论文35

    发卡行主导的智能体支付:Issuer-Sovereign Agentic Payments

    论文提出 Issuer-Sovereign Agentic Payments,让发卡行在 AI 智能体支付时直接掌控授权。持卡人一次性批准消费规则并由银行认证组件记录,智能体向特定商户付款时,银行核对该商户是否符合规则,仅在允许时生成卡片认证值。支付仍走常规卡组织通道并由发卡行验证,执行环节不引入额外依赖。

  2. 论文追踪 · 收录 · 原文 论文45

    研究者提出 AI Agent 获取资源的运行时授权架构

    研究者提出一种基于来源边界的运行时授权架构,用于解决 AI Agent 在获取算力、凭证、账号、服务和其它 Agent 后产生的授权激活缺口。该架构将获取到的输出隔离,通过版本化解析器依据经认证的提供方证据解析其实际能力,并仅在当前激活事务中检查解析出的清单、来源、epoch 以及类型化资源-能力超图上的向下封闭关系包络后才予以激活。在明确假设下,作者证明了隔离、背书、非放大、拆分不可规避、崩溃重试、退款、epoch 和效果限制八项安全属性。在五类资源上,参考语义接受了 20/20 条良性轨迹、拒绝了 40/40 条已登记的不安全轨迹,覆盖 810 个事件;独立检查器在 60 条基础轨迹和 40 条细化轨迹上结果一致,并拒绝了 89/89 项篡改测试。

  3. 论文追踪 · 收录 · 原文 论文49

    Secure-CUA:约束计算机使用智能体中不可信内容的影响

    研究者提出 Secure-CUA,一种面向计算机使用智能体(CUA)的安全执行方案,通过在执行前固定动作事务,约束不可信内容对智能体决策与 GUI 命令执行的影响。该方法把安全要求形式化为对智能体决策及其通过 GUI 命令执行两方面的约束,并在理想执行模型下说明逐步满足这两项要求可保护执行轨迹。Secure-CUA 的核心是在访问不可信内容前先确定一个显式的单动作程序(action transaction),固定对不可信内容的查询及响应的允许用途;系统遮蔽不可信区域,用隔离的查询模型作答,再借助遮蔽后的界面定位目标控件。作者在 400 个 WebArena 任务上用三个前沿模型、5 个随机种子共 6000 条执行轨迹测试,Secure-CUA 平均任务成功率为 53.55%,Vanilla-CUA 为 55.12%,CaMeL-CUA 为 13.17%。

  4. 论文追踪 · 收录 · 原文 论文34

    D²-Monitor:基于犹豫信号的扩散大语言模型动态安全监控

    D²-Monitor 是一种针对扩散大语言模型(D-LLM)的动态安全监控方法,利用中间隐藏状态反复接近探针决策边界的"安全犹豫"信号来判断样本难度。轻量探针先对每个样本给出基础预测和犹豫估计,再决定是否升级到更强探针,后者仅读取至少出现一次犹豫步骤的轨迹最小片段。在 WildGuardMix、ToxicChat、OpenAI-Moderation 3 个数据集和 4 个 D-LLM 上,该方法以不超过 0.93M 参数取得 SOTA 表现,并在 8 个基线中实现最佳效果与效率权衡。

  5. 论文追踪 · 收录 · 原文 论文43

    Agent MechSuits:面向多轮 CLI Agent 的机制子空间安全引导

    论文提出 Agent MechSuits,一个白盒防御框架,从步骤级隐藏表示中检测 CLI Agent 的有害执行状态,并通过干预单层内一个 10 维子空间来缓解不安全行为。作者同时发布 Mechanistic Agent Safety(MAS)基准,包含 194 个任务的多轮执行轨迹标注,覆盖 LLaMA-3.1-8B、Qwen-2.5-7B 和 Gemma-2-9B。实验显示该框架具备较强的安全检测性能,并初步显示出前瞻性风险预判能力,显著减少了 CLI Agent 的有害动作。论文已被 NeurIPS 2026 接收。

  6. arXiv · 收录 · 原文 日期未知论文41

    SLDR:通过选择性层恢复与动态路由防御恶意微调

    研究者提出 SLDR,一种针对微调即服务场景中恶意微调削弱模型拒答行为的后微调防御方法。该方法先重新审视逐层安全诊断,发现安全敏感度具有符号性,不同层的缩放会增强、削弱拒答或影响很小;SLDR 据此只在符号谱中敏感度最高和最低的层上训练 LoRA 恢复适配器,并用基于表征的动态路由推理,仅对恶意查询激活该适配器。在四种模型架构、五个下游任务和四个有害基准上,SLDR 大幅降低有害输出并保持下游效用;在 Llama3.1/SST2 上,平均有害分数从 11.54 降至 0.08,同时保持下游准确率,在最高 0.9 的投毒比例下有害分数仍接近零。代码已开源于 https://github.com/Stardust457/SLDR。

  7. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文50

    OrthoPurify 用一步正交投影净化被后门污染的视觉语言模型

    研究者提出 OrthoPurify,通过一步正交投影净化被植入后门的视觉语言模型权重。作者对后门权重更新做结构分析,发现后门由少量权重更新方向从任务适配被劫持为后门捷径编码,并将该现象称为方向劫持。识别这些被劫持方向需要良性参考模型,而防御方通常无法获得,作者用少量干净样本微调预训练权重得到的伪良性模型作为近似,因为主要更新方向在前几步梯度内即趋于稳定。实验显示该方法将攻击成功率降至接近零,同时在多个基准上保持原有性能,且无需重训练被污染模型,也不引入推理时开销。代码已公开。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文48

    AgentTracer:通过细粒度意图-执行对齐追踪间接提示注入攻击

    研究者提出 AgentTracer,一个意图感知的追踪框架,将间接提示注入视为任务意图漂移,用于事后定位注入来源并重建攻击链。该方法恢复工具调用之间隐含的决策依赖,构建意图驱动的执行图,把分散的工具调用按任务意图连接起来;再结合用户请求与操作知识库构建用户意图授权空间,识别意图漂移的工具调用。从审计中的异常工具调用出发,AgentTracer 通过目标剪枝和反向追踪重建攻击链,定位注入来源与注入点。在 AgentDyn 和 InjecAgent 的成功 IPI 攻击执行日志,与包含 1,800 条用户请求、9,000 次无 IPI 背景工具调用的正常日志混合的端到端实验中,AgentTracer 达到 94.17% 的注入点准确率和 93.56% 的路径精确率,注入点准确率较现有方法提升 18% 至 54%。

  9. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文34

    AI 安全 Stackelberg 模型中的防御充分性研究

    研究将 AI 系统防御建模为防御者主导的 Stackelberg 博弈,防御者投入主动发现与被动修复,攻击者选择搜索强度。理论证明:若每个未解决攻击都有持续被发现的机会、修复有效且后续更新保留既有防护,则有限攻击面可以概率 1 被防御;并给出完成时间界,扩展到攻击面增长、修复跨相关攻击泛化及多种发现机制的情形。数值实验刻画了防御者不投入、只投入一种或同时投入两种能力的均衡区间,并显示更快修复可缩短被攻陷时长但不降低被攻陷概率。

10月7日周三
  1. Hugging Face Daily Papers · 收录 · 原文 论文33

    安全动作不等于可行动作:VICS-G 为 VLA 策略做可行未来解码

    冻结的视觉-语言-动作(VLA)策略可能选中局部安全、却断绝安全完成任务路径的动作,作者将这一现象称为可行性与似然之间的落差。为此提出免训练、告警触发的重排序器 VICS-G,基于安全任务完成约束下的可行未来质量对候选动作重排。在六个 Safety-CHORES 设置中,VICS-G 将平均累计安全代价降低 1.9%-57.5%,成功率与策略采样相差不超过 2.5 个百分点,平均回合长度相差 0.82 步,且无需重新训练策略或在线 rollout。

  2. 论文追踪 · 收录 · 原文 论文33

    MARCO:面向蛋白质生成模型的放射性水印框架

    MARCO 是首个专为蛋白质生成模型(PGM)设计的"放射性"水印框架,同时保护知识产权并实现生物安全滥用的取证溯源。它通过辅助编码器-解码器在扩散逆向去噪过程中迭代嵌入水印,保持原 PGM 参数冻结;并针对 Cα 原子对距离与扭转角(ψ、φ)设计专用损失函数,结合随机攻击模拟的对抗训练提升鲁棒性。水印可自动转移至任何基于加水印数据训练的盗版模型输出,从而对抗模型提取攻击。

  3. 论文追踪 · 收录 · 原文 论文31

    POLAR:面向小型工具调用智能体的可逆性护栏框架

    POLAR 是一种面向小型工具调用智能体的护栏框架,通过结构化两层本体评估动作可逆性,为每个动作生成候选逆序并打分级可逆性分数,未达阈值的调用在执行前被剪枝。在 τ²-bench 上对六个智能体模型评测,六个中有四个在 airline 域平均任务奖励提升 0.11 至 0.18 分,但十八个模型—领域组合中仅八个整体改善,retail 域及较强智能体常出现回退。POLAR 提供可审计的结构化检查,并刻画了任务效用权衡;奖励并非防止伤害的直接度量。

  4. 论文追踪 · 收录 · 原文 论文45

    研究测量策略网关跨平台命令裁决的能力边界

    一项研究测量了不解析 shell 语法的策略网关在跨平台命令裁决上的表现,该网关接收类型化的已实现动作(动词、操作数、解析后的区域、程序对象身份)并输出 ALLOW、ASK 或 DENY。在 Windows 基准的 Linux 对应版本上,61 例冻结用例表两轮均得 61/61 且无误放行;50 个变异算子的变异测试杀死 46 个(92.0%),4 个存活变异体均被归类。82 行审计得到 43 处重新表述、21 处载体差异、16 行研究特定不适用项和 2 个未解决案例,25 行标注为无对应项的记录中有 4 行仍未映射。由执行器调用时,25 次逃逸降为零且未拦截任何良性载荷。在探索性的单网关快照中,三个未认证端点标签的案例级非拒答多数为 81.8% 至 98.0%,但立即执行多数仅为 4.0% 至 52.5%。

  5. 论文追踪 · 收录 · 原文 日期未知论文36

    两阶段智能体轨迹审计框架:用门控规则加 LLM 审计降低监控成本

    研究者提出两阶段智能体轨迹审计框架,第一阶段用单事件与轨迹序列规则筛选待检动作,第二阶段由 LLM 审计智能体结合前序轨迹在执行前审查每个被选动作,并用训练数据联合优化门控规则与审计指令。在公开基准 OpenAgentSafety 上,该框架将每次运行的 LLM 审计次数从 8.15 降至 2.33、token 用量从 47.8k 降至 14.6k,检测率为 72.8%,而全量审计为 81.5%。在两个模拟多智能体案例中,框架标记出全部恶意轨迹,同时将审计 token 用量减少超过 80%。

  6. arXiv · 收录 · 原文 日期未知论文39

    ASCENT:通过一阶最优校准实现安全与效用协同的微调框架

    研究者提出 ASCENT,一个通过一阶最优安全感知周期性校准与任务优化实现安全与效用协同提升的下游微调框架。该方法把安全建模为大语言模型参数的函数 S(θ),用其一阶近似刻画参数更新带来的安全变化;在固定秩与 Frobenius 范数预算下,证明由安全函数梯度前 r 个奇异分量构造的更新能最大化估计的安全变化,并将其用于周期性校准。研究还推导出一个唯一的安全保持任务更新,在贴近原始任务更新的同时惩罚对估计安全变化的负面影响,ASCENT 交替执行这两类更新。在多个大语言模型家族和下游任务上,ASCENT 将下游效用最多提升 20.3%,攻击成功率最多降低 35.5%。代码已开源于 https://github.com/ZJU-LLM-Safety/ASCENT。

  7. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文↑156

    LADE:用暗知识中的模型无关潜在安全信号防御 LLM 越狱

    LADE 通过对比有害与良性查询,从首个 token 输出概率分布的暗知识中提取潜在安全信号,构建跨模型通用的安全方向。该方法由潜在安全信号提取、Tokenizer Mapping 和 kNN 判别三部分组成,可适配不同分词器的 LLM。在多种模型和基准上,LADE 对多种越狱攻击保持稳健,降低攻击成功率并维持安全与效用的平衡。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文53

    APEX:在 LLM Agent 执行边界主动防御间接提示注入

    研究者提出 APEX,把间接提示注入的防御从识别攻击模式转向在执行边界检查每个待执行动作,即 Agent 将内部状态转为外部动作或输出释放的位置。APEX 在不受信任内容到达前把用户任务编译成授权契约,用两个机制读取它:WRAP 依据契约与运行时证据只放行可被证明授权的动作和参数,PLANT 在契约背书的依赖通道上放置探针,使未被任务背书的信息在使用时暴露。该方法只需对每个能力单元做一次与任务无关的注册,同一套中介逻辑统一适用于 Tool、MCP 和 Skill 调用,包括嵌套调用。在覆盖三类能力单元的六个基准上对比 13 个基线,APEX 在其中五个基准上攻击成功率为 0%,第六个为 0.56%,并在针对三类能力单元的自适应攻击下保持 0% 攻击成功率。代码已公开。

    推荐理由APEX 把间接提示注入的防护从识别攻击模式转到执行边界,用授权契约同时约束越权动作与未背书信息使用,并给出跨 Tool、MCP、Skill 的评测数据。

  9. arXiv:可解释性 · 收录 · 原文 日期未知论文32

    针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估

    研究提出一个 2×2 纵深防御框架,将内部激活引导与外部记忆处理分离,在 MemSyco-Bench 上评估四种开放权重模型,涉及 10 个引导系数和五种记忆防御配置。其中三种配置为新设计:重写全部记忆、对每条记忆保留/重写/丢弃的 Router Gate,以及丢弃全部记忆。在 Llama 3.1 8B 上,Router Gate 配合轻度反向引导(α = -1.5)将评委平均谄媚率从 35.80% 降至 31.32%,平均准确率从 43.99% 变为 43.31%,但该下降在 149 个样本上不具统计显著性(配对 p = 0.08 至 0.63)。

  10. arXiv:危险能力与安全评测 · 收录 · 原文 日期未知论文37

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。作者发现路由 logits 对多模态输入是否安全具有很高的预测性。在 Qwen3-VL 和 Kimi-VL 上,该检测器显著降低了 HoliSafe 基准上的安全错误,并泛化到安全模式不同的分布外基准 MISHard 和 MM-SafetyBench。作者认为,相比通过提示、监督微调或路由专家引导来干预模型行为与内部状态,直接读取自然涌现的信号并接入外部安全机制,可作为现有安全干预的简单、有效且非侵入式的补充。

  11. 论文追踪 · 收录 · 原文 论文44

    AdvSim2Real 用任务与注入对手共同演化训练网页智能体

    AdvSim2Real 提出在冻结的网页世界模型中让任务课程、注入对手与智能体共同演化,以提升网页智能体对页面植入指令的鲁棒性。课程只奖励智能体约一半时间能解决的任务,对手只奖励能把判定成功翻转为失败的注入。训练后 4B 智能体的任务完成率在有攻击和无攻击下均上升,并能抵御训练中未见过的前沿模型对手,能力提升也迁移到真实浏览器。在 150 个网页任务上,面对这一未见对手,AdvSim2Real 相对基础智能体把完成率提升 33.6%。

  12. 论文追踪 · 收录 · 原文 论文46

    研究者提出 Staged Decoding 与 SFT 数据集,减少大推理模型推理轨迹中的隐私泄露

    研究者针对大推理模型(LRM)推理轨迹常含敏感信息、且可能被提示注入暴露的问题,提出把隐私指令当作可控性任务来处理。他们构建了一个 SFT 数据集,让模型在整个推理过程中遵循通用指令,并提出 Staged Decoding 解码策略,用独立的 LoRA 适配器分别生成推理轨迹和答案,以最大化各部分的指令遵循能力。在来自两个模型族的六个模型(1.7B 至 14B 参数)上,跨两个指令遵循基准和两个隐私基准评测,该方法在指令遵循上最高提升 20.9 分,在隐私基准上最高提升 51.9 个百分点,但可能因推理性能与指令遵循之间的权衡而损失任务效用。代码已公开,论文被 EMNLP 2026 主会接收。

  13. 论文追踪 · 收录 · 原文 论文52

    CoVer:用干预检验为 Agent 构造可判定规则边界

    论文提出 CoVer(corroborate-then-verify)方法,用于判断 Agent 执行的规则中哪些可由固定检查处理、哪些需要裁判。研究者在六个语料库(包括 EU AI Act、FINRA 指引和一个已部署的信贷 Agent)上,从三个实验室的四个模型收集约 2.2 万条标注,发现模型在答案明显时几乎完全一致,但在监管文本上分歧严重,且错误方向相反,无法把任一模型当作保守选择;在已部署 Agent 的规则集上,模型还会共同错误地声称固定检查足够,而这一方向永远不会被升级审核。CoVer 把模型一致视为提名,只有当为该谓词合成的检查能通过干预、读取 Agent 无法写入的字段并在确定性改写下保持成立时才接纳该谓词,从而拒绝大部分仅靠一致同意被错误接纳的谓词,代价是覆盖率的下降。

  14. 论文追踪 · 收录 · 原文 论文42

    论文提出长程智能体自生子目标的运行时授权机制

    论文针对长程工具调用智能体在自生子目标、重规划和委派中可能超出主体授权任务的问题,提出一种运行时授权机制。每个目标图变更需携带版本绑定的见证,证明其延续轨迹、资源、义务、不变量和收束条件细化了当前根契约,受保护效果在原子提交边界重新校验,自由形式的目标文本不提供任何授权。作者在显式中介、抽象、新鲜性和原子性假设下证明了轨迹策略与建模禁止状态保持、条件性根成功保持、无记忆允许列表的分离结果、有限域可判定性以及可靠抽象细化下的通用安全单调性。可执行模型探索了 340 个状态和 419 次转移;在覆盖 25 种结构模式的 96 个匹配案例中,完整机制在 48 个漂移案例中零禁止状态提交,并完成全部 48 个良性对照。两条公开上游运行时路径在 32 个案例中执行 258 次原生调度,每个案例级决策与凭据链均匹配。

10月6日周二
  1. 论文追踪 · 收录 · 原文 论文46

    论文提出可审计的文本水印合规方案以落实欧盟 AI 法案第 50 条

    针对欧盟 AI 法案第 50 条第 2 款要求生成式系统输出可机器读取和检测,论文提出一套可审计的替代方案。作者先定义描述长度鲁棒性剖面,用有限样本界说明可检测偏差会衰减、所需样本量随衰减率的平方反比增长,并以碰撞熵替代难以确定的 Shannon 熵常数。随后构建标签条件共形预测集,分别设定误归因与误排除水平,输出水印支持、不支持或不确定三种结论,覆盖率以有限样本结果给出并在可交换性下具备类条件性质。一个可复现的锦标赛水印小规模模拟验证了上述两点,并显示存活 token 规则把可容忍编辑率大约高估了一倍。论文据此提出上市前证书、签名检测报告和上市后重校准协议,用于落实欧盟委员会 2026 年行为准则,同时不主张水印具备普遍鲁棒性。

  2. 论文追踪 · 收录 · 原文 论文40

    研究者提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    研究者提出一种失败即关闭的临时可见性协议,用于控制持续摄入场景下 RAG 向量库的投毒暴露:新内容在截止期限内以临时状态准入,验证未及时完成的内容被隐藏,并支持按血缘范围隔离。在五组编码自然语言文档负载上,使用精确后端与 Milvus 评测,验证器积压时该截止机制把投毒检索的中位数从 34(29–34)降到 7(6–7),被挤出的干净结果数量同步下降。先验证后可见可避免临时暴露,但干净内容首次可见延迟到 6.3 秒,而临时准入可在 3 毫秒内可见,代价是过期干净条目可能出现临时可用性缺口。用特定检测器回放决策显示,误放行会让投毒内容保持可见,误拒答则会把干净内容排除在检索之外,说明协议保证与检测器质量各自决定哪些结果。该工作已被 IEEE CBDCom 2026 接收。

  3. 论文追踪 · 收录 · 原文 论文54

    Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月

    据 Uber 团队自报,Uber 团队提出 ADR(Agentic AI Detection and Response)系统,用于防护通过 MCP 运行的 AI 智能体,由采集提示词、推理步骤与工具调用因果链的 ADR Sensor、预部署红队的 ADR Explorer 和两级在线检测的 ADR Detector 组成。该系统在 Uber 部署超过十个月,覆盖 7200 多台主机、每日处理逾 1 万次 Agent 会话,发现 26 类凭证泄露,并支撑一个精确率 97.2% 的凭证泄露拦截层。ADR-Bench 与 ADR Sensor 及检测框架源码已在 GitHub 公开。 上述部署规模及效果来自团队自身报告,并非独立验证结果。

    推荐理由Uber 团队公开了在 7200 台主机上运行十个月的 Agent 检测系统架构与 ADR-Bench 基准,可供企业搭建 MCP 安全监控时对照。

  4. arXiv · 收录 · 原文 日期未知论文24

    面向音频深度伪造检测的任务感知联合剪枝与蒸馏框架

    针对基于自监督学习(SSL)的音频深度伪造检测器参数量普遍超过 300M、难以部署到资源受限设备的问题,研究者提出任务感知联合剪枝与蒸馏框架,将跨域知识蒸馏与运动引导结构化剪枝结合,在激进压缩下保留伪造判别知识与关键结构。该框架把模型压缩至 31.9M 参数、FLOPs 降低 6.3 倍,在多个数据集上相比未压缩基线平均性能仅下降 1.30%。

  5. arXiv · 收录 · 原文 日期未知论文37

    AVCE:面向扩散模型可验证概念擦除的审计感知遗忘框架

    研究者提出 AVCE(Auditing-Aware Unlearning for Verifiable Concept Erasure in Diffusion Models),一种把概念擦除落到模型潜空间表征的遗忘框架。作者指出,多数擦除方法只在文本接口干预,通过提示词修改或文本条件权重的局部更新实现,并以给定提示词下的输出作为评估依据,而潜空间审计绕过文本条件直接探测去噪网络,显示被擦除概念仍可从内部表征中恢复,这一问题在抗对抗提示词的方法中同样存在,且随擦除概念数量增加而加剧。AVCE 审计每个概念的嵌入向量邻域,将发现的脆弱方向压缩为最弱几何点上的锚点,在该锚点以闭式解编辑交叉注意力和自注意力投影,再用路径级审计损失微调两条路径,并通过正交梯度投影整合多个概念。

  6. arXiv · 收录 · 原文 日期未知论文32

    Thrive:面向自回归 TTS 的抗重建攻击多比特语音水印框架

    针对自回归 TTS 合成语音在分发编辑中经历学习式重建后水印难以可靠恢复的问题,研究者提出多比特生成式语音水印框架 Thrive,覆盖离散 token 与连续表示两种生成范式。其 Rise 模块将水印注入中间表示并与后续生成同步,Care 模块按比特可靠性融合波形与频谱专家。实验显示 Thrive 在保持合成保真度的同时,于重建攻击下取得 87.6% 平均恢复准确率,并支持最多 10,000 个候选身份的来源归属。

  7. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文55

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    牛津大学等机构的研究者发现,为每个智能体单独部署 CaMeL 防护不足以保证多智能体系统安全:不可信数据跨越智能体边界后被下游智能体当作可信输入,从而劫持其控制流,作者将这一失效模式称为 boundary laundering,并构造了具体攻击。为此他们提出 multi-CaMeL,在智能体间通信中把可信自然语言指令与不可信数据分离到不同通道,并在运行时保留数据来源信息。在扩展 AgentDojo 得到的 MultiAgentDojo 基准上,multi-CaMeL 将攻击成功率从无防护的 12.9%、单智能体 CaMeL 的 0.2% 降至 0.0%;在 AssetOpsBench 上相对单智能体 CaMeL 平均仅增加 3.2 个百分点的效用损失,且模型能力越强损失越小。作者同时开源了 MultiAgentDojo 及 multi-CaMeL 实现。

    推荐理由论文给出多智能体系统中单智能体防护失效的具体攻击路径,并配套发布可复现的多智能体评测基准与防护实现。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文35

    SENTINEL:通过意图感知的输入-输出匹配防御 LLM 越狱

    研究者提出生成时越狱防御方法 SENTINEL,将防御重构为意图提取问题,利用指令微调 LLM 的输入-输出语义一致性,匹配语义对齐区域以提取暴露意图的子序列,并用拒答方向投影打分、必要时中止生成。在 HarmBench 上对多个 LLM 的实验中,SENTINEL 将越狱成功率降至接近 5%,同时保持较低的过度拒答,并对自适应攻击表现出鲁棒性。

  9. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文31

    无需目标答案的潜在空间安全对齐:无监督对抗训练提升 LLM 越狱鲁棒性

    针对现有对抗训练依赖固定有害目标或固定良性—有害数据对做定向激活消融、导致对抗样本行为单一的问题,研究者提出无目标对抗训练框架 Target-free Latent Safety Alignment,以无监督方式放大并多样化模型潜在空间中的行为级偏移,生成语义多样的对抗样本。该方法用语义熵作为输出层面的对抗行为多样性度量,在目标模型上诱发出多种有害行为,缓解行为窄化并提升对越狱攻击的鲁棒性。

  10. 论文追踪 · 收录 · 原文 论文40

    SRFT:让 Agent 从失败经验中自我反思以抵御提示注入

    研究者提出 Self-Reflection Fine-Tuning(SRFT)训练框架,让 LLM Agent 通过从自身在对抗条件下的失败经验中学习来提升鲁棒性。该方法不被动模仿专家行为,而是让 Agent 接触由注入攻击构造的被污染轨迹,再由专家模型生成结构化的自我反思推理,对比不安全动作与最优动作,从而学会识别恶意指令、推理其后果并保持与原始用户意图一致。作者基于 Llama-3.1-8B-Instruct 和 Qwen3-8B 构建了 SR-Agent,并在静态与自适应提示注入基准上评测,结果显示 SRFT 大幅降低攻击成功率,同时保持任务性能,在自适应攻击下也表现出较强泛化能力。代码已公开。

  11. Hugging Face Daily Papers · 收录 · 原文 论文32

    OmniConfess:用 Token 级「忏悔」缓解全模态幻觉

    研究提出免训练的 OmniConfess,通过固定候选回答、在受控的分通道证据干预下按 token 粒度重新打分,生成结构化的「token×通道忏悔」,从而定位回答依赖的证据,保留有依据内容、纠正由无关或矛盾证据驱动的表述。作者同时构建了 OmniHalluBench,由六个数据集组成、覆盖文本、图像、音频、视频及判断与自由生成,共 3,540 个样例;实验显示该方法在多种模态与任务设置下均能缓解幻觉,代码与基准已公开。

  12. 论文追踪 · 收录 · 原文 论文42

    RAISED:用自蒸馏抵御工具调用中的提示注入

    论文提出 RAISED(Robust Attack Invariance through Self-Distillation)训练框架,用于抵御工具调用型语言模型智能体面临的间接提示注入。作者指出,现有训练式防御会显著改变模型输出分布,在良性场景下也造成行为漂移,并存在一种失败模式:在良性工具使用任务中,模型会省略完成授权任务所需的步骤,尤其是该步骤由工具输出指示时。RAISED 先让模型自行生成工具使用场景,重点覆盖需要依据工具输出中的合法指引才能完成任务的情形,再通过自蒸馏让学生在同一轨迹的干净版本与注入版本上都对齐教师的干净上下文行为。论文称该方法大幅降低工具响应中提示注入的攻击成功率,且不同于此前的训练式防御,在智能体与通用基准上都能保持效用。

  13. arXiv:可解释性 · 收录 · 原文 日期未知论文32

    EmoRSS:缓解大语言模型由情绪引发的过度拒答

    研究发现情绪化表达会系统性提高大语言模型对良性请求的拒答倾向,造成不必要的过度拒答。为此提出的 EmoRSS 是一种激活引导方法:先用逐层线性探针定位拒答敏感层,并基于与探针方向对齐的稀疏自编码器(SAE)特征构建拒答子空间,再用同一查询的常规与情绪化请求对估计该子空间特征的平均激活偏移,将其解码为激活干预向量,在推理时沿反向拒答方向施加,且不更新主干参数。在两个大语言模型上的实验显示,当请求含情绪化表达时,EmoRSS 在拒答有害请求与回答良性请求之间取得了优于既有过度拒答缓解基线的权衡,同时更好地保留通用任务性能。

10月5日周一
  1. Hugging Face Daily Papers · 收录 · 原文 论文32

    FailBank:用运行时反馈自进化提升 VLA 模型任务成功率

    针对视觉-语言-动作(VLA)模型中运行时护栏只纠正单次动作、不改变底层策略的问题,研究者提出四阶段自进化框架 FailBank,把运行时反馈转化为持久的策略改进。在 VLA-Arena 基准的两个难度等级和两个 VLA 主干上,FailBank 相比基础策略将任务成功率提升 8.5 和 6.9 个百分点,策略引发的累计代价降低 35.6% 和 23.8%;相比运行时护栏,成功率提升 25.4 和 9.5 个百分点,累计代价相当。

  2. 论文追踪 · 收录 · 原文 论文46

    MIRROR:面向多智能体通信的法定人数完整性防御

    研究者提出 MIRROR,一种通信层完整性原语,用于防御 LLM 多智能体系统中的 Agent-in-the-Middle(AiTM)攻击。该方法将同一规范化载荷复制到 k 条逻辑路由,仅当严格多数路由报告相同摘要时才接受消息,其安全性来自诚实路由占多数的假设,而非密钥认证。作者在路由被攻陷比例 alpha < 0.5 下给出保证,并扩展到路由故障相关的情形,指出关键量是最大共享故障组规模而非路由数量;同时证明可用性与完整性在同一阈值退化,低于 alpha = 0.5 时法定人数拒绝和丢消息攻击者无法阻断诚实流量。该工作已被 NeurIPS 2026 FLMSec Workshop 接收。