跳到正文

防御与护栏

今天新收录 14 条(含旧文)

第 2 页更新的内容回到最新

10月5日周一
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    论文提出在 Kubernetes 上保护 AI Agent 的七层纵深防御框架与参考架构

    论文主张不应把模型本身当作安全边界,Agent 在 Kubernetes 上的安全应作为基础设施问题处理,所有保证都需在 Agent 已被提示注入完全攻陷的假设下成立。作者提出十类威胁分类法(对齐 OWASP 智能体应用指南)、九条设计原则(核心是工具边界的完全中介,以及打破不可信输入、敏感访问与外部外发三者的组合)、七层纵深防御框架,并映射到工作负载身份、RBAC 与 ValidatingAdmissionPolicy、基于 SIG Apps Agent Sandbox 项目的 gVisor/Kata 沙箱、FQDN 感知的外发策略、带策略即代码的 Agent/MCP 网关与 eBPF 运行时执行等 Kubernetes 原生机制。作者未报告实测的攻击成功率或性能开销数据,而是列出残余风险和验证该框架所需的测量项。

  2. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文42

    研究提出基于收缩约束状态空间模型的有界可达性与越狱检测方法

    论文研究基于状态空间模型(SSM)的安全头何时能被认证为对嵌入空间有界扰动内的所有输入给出相同预测,证明关键在于状态转移矩阵的 l∞ 范数满足收缩条件(‖A‖∞<1),此时可对线性时不变分类器做精确区间界传播(IBP)认证。收缩条件成立时可达输出区间稳态宽度有界,样本可被认证为鲁棒分类;条件不成立时区间随序列长度指数增长,任何实际扰动半径下都无法认证。作者用 hinge 惩罚强制收缩,在有毒评论数据上把认证比例从 41% 提升到 59%,并在 ‖A‖∞=1 处观察到与理论一致的相变。将收缩正则化的 S4 头用于 JailbreakBench 越狱检测,零样本迁移到 AdvBench 的 DR=0.994、HarmBench 的 DR=0.988。

  3. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文44

    Whiteout:用混淆样本阻止 LLM 泄露个人敏感信息

    研究者提出 Whiteout,一种在个人提出请求后阻止 LLM 复述其真实个人敏感信息(PSI)的工具,做法是用精确设计的混淆样本覆盖这些信息。作者指出,现有基于机器遗忘的缓解方法往往删除过多信息、损害模型效用与安全性,且易受攻击。Whiteout 在多家厂商、不同规模的现代 LLM 上评估,其中包括一款广泛使用的 OpenAI 模型,结果显示它能有效阻止目标 PSI 被披露,对模型效用与安全性影响可忽略,并优于现有替代方案。研究还测试了 Whiteout 对黑盒攻击(如越狱)和白盒自适应攻击(如重学习、量化)等反制手段的鲁棒性,并讨论了其安全与伦理影响。

  4. arXiv:可解释性 · 收录 · 原文 论文33

    检测与抑制:针对 VLA 模型对抗补丁的机制可解释性防御

    研究者用稀疏自编码器(SAE)分析 VLA 模型内部表征,找到一个激活与对抗补丁存在强相关的特征,并仅在线性探针检测到攻击时于推理阶段抑制该特征,无需微调即可提升鲁棒性。在 LIBERO-10 上的对抗补丁攻击测试中,条件式干预提升了间歇性攻击下的成功率,而持续施加同一干预会显著损害策略性能,表明控制干预时机对减少对正常策略行为的干扰至关重要。

  5. 论文追踪 · 收录 · 原文 论文43

    Pincer:用数字分身学习用户偏好并执行动态最小权限

    研究者提出 Pincer,一种在资源层运行、可与工具调用层现有防御并行的 Agent 防御方案。其核心是数字分身,一个隔离上下文的模型,自动学习并执行针对具体用户的动态最小权限策略,在 Agent 发出权限请求时充当用户代理。为模拟学习阶段,作者构建了一个以用户为中心的数据集,样本来自多天的用户与 Agent 交互记录。评估显示,Pincer 在安全性和实用性上均优于多个基线,包括多种 LLM 评判器变体和 Conseca(HotOS '25)的改造版本;在部分攻击类型上,其设计带来的安全提升明显高于所有其他基线。论文指出,当前 Claude、Codex 等部署中的 Agent 主要依赖用户维护策略与 auto mode 沙箱,前者会随时间失效并造成用户疲劳,后者的工具调用分类器不学习用户特定策略。

  6. 论文追踪 · 收录 · 原文 论文43

    AgentTrap:面向自主渗透测试 Agent 的有状态反馈欺骗蜜罐

    研究者提出 AgentTrap,一种面向自主渗透测试 Agent 的闭环蜜罐,通过哨兵端点避免误伤正常流量、基于被保护应用的状态化欺骗,以及行为引导的升级策略来维持交互并收集 Agent 侧行为证据。在部署的 Web 应用中,研究团队用真实应用端点与独立蜜罐端点、三种防御策略对八种自主渗透测试 Agent 进行评测。相比无防御,AgentTrap 将真实目标的总体攻击成功率从 95.8% 降至 79.2%,并在 18.8% 的运行中成功诱导出攻击方 API key,效果优于静态欺骗与固定升级策略。轨迹分析显示,Agent 抵御此类反制的能力同时取决于模型层面对欺骗性请求的识别和架构层面对敏感资源的隔离。

  7. 论文追踪 · 收录 · 原文 论文53

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    剑桥大学等机构的研究者提出 COBRA,一种针对计算机使用 Agent(CUA)分支引导攻击的系统级防御架构。作者指出,Dual-LLM 模式虽能保证控制流完整性,但在图形环境中计划必须按运行时网页内容分支,攻击者可构造不可信数据把 Agent 推向预先批准的危害路径,而无需注入新指令。为此作者构建 STEER-Bench,覆盖 9 个领域 101 个任务,测得分支引导攻击对标准 CUA 的攻击成功率为 94.4%,对原版 Dual-LLM 为 89.5%。COBRA 在规划阶段为每个分支预先固定目的地、端点和工具参数约束,由 Branch Resolution Hub 校验运行时分支与参数,并在 HTTP 与 MCP 代理处强制执行。代码已开源于 GitHub。

    推荐理由论文把分支引导攻击归为数据流完整性问题,并给出在 HTTP 与 MCP 边界施加分支级约束的架构,附开源代码与多基准结果。

  8. 论文追踪 · 收录 · 原文 日期未知论文52

    研究显示少样本微调可绕过安全层局部冻结与修复防御

    研究者测试了针对少样本有害微调的安全层定位与修复防御能否在攻击变化后继续生效。在来自四个模型家族的六个检查点上,攻击后有害与良性提示仍线性可分,把完整干净隐状态打补丁进受损模型可在可复现的过渡深度恢复拒答。但按该深度冻结所有层后重做攻击,在一百条有害样本下六个检查点拒答率仍接近零,恢复过渡出现在冻结边界之上。第二项研究中,移除更新最大的两个奇异方向可在四个检查点的短时仅注意力微调后恢复拒答;在 Llama-3.1-8B 上,常规训练变化会削弱这种修复,攻击者分散更新即可将其击败,而在良性 Llama 微调上校准的谱检测器漏掉了该检查点上的多数修复失败。作者据此提出针对自适应微调防御的五项检查,代码已公开。

  9. Apple Developer · 收录 · 原文 日期未知28

    Apple 调整 macOS 完全磁盘访问权限管控

    Apple 宣布将为 macOS 的完全磁盘访问(Full Disk Access)引入额外管控,用户只有在非常明确的主动操作下才能授予应用这一权限。Apple 称部分开发者对该权限的使用方式可能让用户面临风险,暴露文件、邮件、信息和浏览历史等内容,对通讯类应用还会波及通信对象的隐私。Apple 表示,随着 AI 智能体能力与自主性增强,这一级别访问权限带来的风险将大幅上升。

  10. 论文追踪 · 收录 · 原文 论文54

    TACIT:从 LLM 内部状态检测 Agent 轨迹危害

    多伦多大学研究者提出 TACIT,用冻结 LLM 内部状态的线性探针判断工具调用轨迹是否安全,不解码任何 token。分析发现,现有开源护栏模型对不安全工具使用在输出上仅相当于随机水平,但该区分在模型内部状态中线性可读,且与有害内容方向近乎正交,两者不能互相替代。在六个轨迹安全基准上,TACIT 将平均 macro-F1 从最强开源护栏的 62.3 提升到 86.2(Qwen3-4B)和 85.4(Llama-3.1-8B);每个基准完全留出训练时仍以 65.7 对 61.1 领先。相同骨干、数据与测试划分下,冻结读数与全量安全微调相当,叠加在微调模型上还能进一步提升;探针可训练参数量约为全量微调的百万分之一,训练时间约六分之一,推理延迟 40ms,低于 Qwen3Guard 的 215ms。

    推荐理由论文给出用冻结模型内部状态做轨迹安全判读的方法,并附与护栏模型和全量微调的对比数据,可供做 Agent 监控的团队参考。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文36

    依赖引导回滚修复:为记忆增强 Agent 恢复错误记忆后的答案与状态

    研究者提出依赖引导回滚修复(dependency-guided rollback repair),用于在记忆增强 Agent 执行失败并诊断出错误记忆后,同时恢复答案与持久状态并保留未受影响的工作。该方法从运行时溯源构建带类型的记忆到动作图,追踪显式下游依赖,保留有独立可信支持的候选,停用无支持的记忆状态,并只选择性重放与答案相关的受影响计算。在覆盖三个工具使用领域、四类记忆故障的 150 例受控基准上,恢复率达 85.3%,高于最佳对比方法的 77.3%,同时移除全部被诊断的错误记忆并保留全部良性记忆;在改编自 LongMemEval-V2 的 50 例轨迹压力测试中恢复率为 68.0%,对比方法为 54.0%,主张失效 F1 为 0.669 对 0.603。作者指出结果并不代表轨迹重建全面更优,而是显示该方法在恢复与成本之间取得较好权衡。

  2. 论文追踪 · 收录 · 原文 论文29

    贝叶斯辩证论证(BDA):面向持续对抗下多 LLM 委员会的可校准聚合

    针对多 LLM 委员会在部分智能体持续不可靠时置信度无法反映正确概率的问题,研究者提出贝叶斯辩证论证(BDA),把委员会中提议、质疑、让步等类型化动作视为带每个智能体可靠度的标注者模型观测,从而将多智能体审议转化为可靠度估计问题。BDA 按推断出的智能体可靠度加权证据,输出候选答案的可校准后验概率,并能反转而非仅票数压制持续不可靠的智能体。在二分类与多分类基准上,BDA 在零额外 LLM 调用成本的委员会聚合方法中取得最佳校准,并在持续对抗联盟下提升鲁棒性,干净场景中仍具竞争力。

  3. 论文追踪 · 收录 · 原文 论文46

    研究者提出自蒸馏方法让 LLM 遵循上下文水印指令

    研究者提出两阶段自蒸馏训练方法,让大语言模型在遵循上下文水印(ICW)指令的同时保持回答质量。ICW 通过在查询前附加指令,要求模型在回复中嵌入可统计检测的信号,第三方无需访问模型内部即可调用。团队同时发布 ICWBench 基准,包含三类可验证的 ICW 指令族,分别从可检测性和回答质量两方面评分;对 14 个前沿闭源与开源模型的评测显示,没有一个模型能在三类指令上同时满足两个目标。所提方法无需更强模型蒸馏、无需人工标注、也不依赖模型已有的 ICW 指令遵循能力:第一阶段用同一基础模型同时充当教师和学生,通过指令等价的解码时 logits 扰动让教师遵循指令,再训练学生匹配教师的输出分布;第二阶段以自动验证器为奖励做强化学习。

  4. 论文追踪 · 收录 · 原文 论文38

    CAGE:面向工具调用 Agent 的类型化返回不确定性认证授权方法

    研究者提出 CAGE,用于在工具返回存在绑定错误与数值漂移时,判断候选动作是否仍处于授权范围内。作者证明分类通道与数值通道分别认证无法组合,各自安全的扰动可能联合使同一动作变得不安全,因此 CAGE 直接对联合邻域做认证,精确枚举离散分支并在每个分支内认证连续扰动。在合成、policy-as-code、监管与真实交易等场景中,CAGE 消除了精确逐点门控会放行的预算内误授权,同时保留一定比例可自主执行的决策。当策略可执行时由 CAGE-Exact 认证策略本身,否则由 CAGE-Lip 与 CAGE-RS 在明确且可测量的保真度假设下认证学习得到的门控。

  5. 论文追踪 · 收录 · 原文 论文42

    Twin Agent:面向权限分离智能体的上下文残差压缩

    研究者提出 Twin Agent,一种受残差编码启发的通用权限分离设计模式,用于抵御来自不可信上下文的提示注入攻击。该设计由两个近似对称的智能体组成:Explore Agent 检查不可信信息,Safe Agent 执行特权操作;Explore Agent 以 Safe Agent 当前上下文为条件,只向其传递关于下一步动作的紧凑提示,从而减少维持任务效用所需的信息量。作者通过测量提示长度变化时效用与攻击成功率的变化,验证了该设计在安全与效用之间取得更好的权衡。在 SWE-bench Lite 的长程软件工程任务以及 AgentDojo、DecodingTrust-Agent 的异构多工具交互任务上,Twin Agent 在保持高任务效用的同时阻止了提示注入攻击,表现优于无防御智能体和权限分离基线。

  6. 论文追踪 · 收录 · 原文 论文41

    IntentCap 提出按任务意图限定 LLM Agent 权限的机制

    论文 IntentCap 提出 LLM Agent 的能力应按当前任务意图限定,而不是按沙箱或会话生命周期限定。作者指出,用户请求、工具返回结果、文档、shell 输出、Skill 与 MCP 指令、记忆等上下文来源都进入同一规划通道且影响力相同,但信任级别不同,对抗注入或范围意外扩大都可能让低信任来源获得选择目标或扩大权限的能力。IntentCap 从用户意图、工作流指令、工具 schema 和运行时环境四类来源组合能力,采用字段级归属与单调收窄,任一来源都不能填补其他来源的字段,生成的租约只能收窄用户已授权权限。系统用 LLM 生成短期租约,由确定性检查器在任何副作用提交前校验,并通过工具层与操作系统层的信息流策略执行。评估显示 IntentCap 能阻断测试中的违规行为且不拒绝正常操作,各来源边界均独立必要,检查器可跨工具、执行、放置和委派边界泛化。

  7. 论文追踪 · 收录 · 原文 论文36

    CAVA:面向智能体 AI 运行时治理的规范动作验证与证明

    论文提出 CAVA(Canonical Action Verification and Attestation),一个运行时语义层,用于把本地编码钩子、SDK 工具、浏览器自动化、托管智能体轨迹、API 网关和工作流引擎等异构运行时中的智能体活动转换为规范运行时动作对象。CAVA 位于 Proof-Carrying Agent Actions(PCAA)之下,PCAA 定义部署方拥有的路线-审查-证明治理流程,CAVA 定义该流程所治理的稳定动作对象。论文形式化了规范动作身份、语义模式检测、审批绑定、回执完整性、运行时可移植投影和可选证明基底。作者通过一个 96 种子、384 变体的基准测试参考实现,覆盖语义等价、语义分离、包装器绕过、误报控制、审批绑定、回执可复现性、证明篡改检测、运行时可移植性、语义模式检测、策略退化和 Azure 部署演练。

  8. 论文追踪 · 收录 · 原文 论文35

    Janus:面向长时程智能体安全的前瞻性潜在风险预测框架

    研究者提出 Janus,一个面向长时程智能体安全的前瞻性框架,通过多智能体模拟合成多样化轨迹,训练护栏模型从部分轨迹中预判延迟风险。Janus 联合优化风险预判与安全裁决两项任务,采用 CoAA-RL 以预判对下游安全判断的效用作为奖励。所得护栏模型 Vanguard 可在动作执行前拦截不安全行为,在四个智能体安全基准上平均防护能力较基线护栏提升 15.9 个百分点,同时良性任务完成率提升 5.1 个百分点。

  9. 论文追踪 · 收录 · 原文 论文27

    拆解 LLM 交互中的隐私-效用权衡:Veilmind-4B 意图驱动本地保护框架

    研究系统分析了 LLM 交互中隐私清洗对下游性能的影响,揭示三项机制:数据价值随用户意图在关键约束与可弃噪声间切换、清洗方式(删除或替换)取决于任务对事实完整性还是结构连贯性的依赖、属性间存在协同依赖或对抗冗余的语义网络。据此提出意图驱动的本地保护框架,蒸馏轻量模型 Veilmind-4B 驱动动态提取-清洗-恢复流程,在保持低泄漏隐私点的同时,响应效用显著高于现有隐私基线,将隐私-效用权衡推向帕累托前沿。

  10. 论文追踪 · 收录 · 原文 论文36

    AgentRewind:面向长周期 LLM Agent 的可恢复执行框架

    研究者提出 AgentRewind,一个运行时恢复框架,通过记录 Agent 上下文与受控环境对齐的检查点,让 Agent 能回到较早状态并利用此前尝试的信息继续执行,以应对长周期任务中早期错误在上下文和环境状态中传播、后续动作难以逆转的问题。作者同时构建 MettleBench,用于评估包含一系列相关需求的长周期工程任务上的任务完成度与部分进展。在多种任务、多个模型、执行策略和 Agent harness 上的实验显示,AgentRewind 相比对比基线提升了任务成功率和平均清单进度。论文共 19 页、5 张图,发布于 arXiv(2608.14380)。

  11. 论文追踪 · 收录 · 原文 论文38

    FlowReview:以授权配对评测控制多智能体组合信息流

    研究者提出授权配对评测(authorization-paired evaluation),把拦截被禁止用途与完成必需授权用途设为同一成功标准,并给出 FlowReview 框架,串联对象解析、权限排序与确定性执行。在受控组合实验中,对组合产物进行审查把拒绝提交率从 86.0% 降到零,且未损失授权供给。作者据此指出,仅保留信息与来源血缘不足以确保正确的权限归属,对象身份与权限必须通过输出可验证的组件与执行保持连接,多智能体安全需要在治理组合信息流的同时保留使协作有价值的授权能力。论文共 44 页、9 张图,代码与数据已公开。

  12. 论文追踪 · 收录 · 原文 论文42

    ZeroGate:为受治理 AI Agent 运行时提供保留信任的快速路径

    Zexun Wang 提出 ZeroGate,把精确动作审批与持久化本地准入分离:签发方签署短时 ActionPass,受信任的运行时适配器在本地门检查绑定并消耗 nonce 前重建最终动作,并用 SQLite 事务把 nonce 消耗、配额更新与准入回执耦合在一起。论文给出条件性决策保持命题:在审批可靠、策略依赖完整且最新、观测忠实、消耗原子等前提下,本地准入成功意味着指定的同步策略会在准入点授权同一动作。作者强调实现本身不保证当前世界的新鲜性,也不保证远程效果恰好一次。评估包含语义夹具、并发与崩溃实验,以及 Azure Blob 上同步与准备式执行的对比:4800 次云端尝试中,准备式从 worker 准入到分发的 p95 为 9.802 至 11.374 ms,同步方式为 25.018 至 334.000 ms,但准备式的完整生命周期均值在各并发级别都更长,边界改善并非净加速。

  13. 论文追踪 · 收录 · 原文 论文56

    SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%

    加州大学伯克利分校研究者提出 SecOPD,用同策略蒸馏为防御微调提供 token 级反馈,替代 DPO、GRPO 等序列级信号。训练时学生模型在含注入的输入上生成 rollout,冻结的初始化模型在去掉注入的干净输入上为同一批 token 打分,与可信任务一致的 token 被鼓励、跟随注入的 token 被抑制。在 Qwen3.6-27B 上,面对 SoTA 自适应攻击 PISmith,SecOPD 的攻击成功率为 9.0%,此前 SoTA 的 Meta-SecAlign 为 94.0%,GRPO 为 61.2%;静态 SEP 攻击下 SecOPD 为 1.3%。在训练未见的 AgentDojo 工具调用场景,SecOPD 为 4.7%,Meta-SecAlign 为 5.5%,GRPO 为 0.7% 但效用降至 82.5%。代码与模型已开源。

    推荐理由论文给出 token 级反馈的防御微调配方,并报告在自适应攻击与工具调用场景下的 ASR 对比,可作防御方案选型参考。

  14. 论文追踪 · 收录 · 原文 论文40

    ActionGuard:在工具调用执行前拦截被投毒技能

    研究者提出 ActionGuard,在技能影响的工具调用即将执行前进行授权检查,以阻止被投毒技能诱导的数据外泄、文件删除或未授权代码执行。该方法把目标智能体的动作生成上下文与护栏的授权上下文分离,Reviewer 不接触可能被投毒的原始技能文本,而是依据平衡后的技能画像、当前及近期工具调用和本地脚本内容,判断每个动作是否由可信用户请求所支持。ActionGuard 在 OpenClaw 的 before-tool-call 阶段拦截每次工具调用,并以 fail-closed 策略执行 ALLOW 或 DENY 决定。在 SKILL-INJECT 设置下,针对 139 个上下文注入和 180 个明显注入,使用三个开源和两个商用 Reviewer 模型与 Dynamic Guardian、SkillGuard 对比,每种条件重复三次,以攻击成功率(ASR)和任务成功率(TSR)评估。

  15. 论文追踪 · 收录 · 原文 论文29

    面向软件交付决策门禁的智能体安全审计器持续保障机制

    针对基于 LLM 的仓库审计器在 CI 流水线中作为安全控制时因非确定性行为和策略变化难以维持即时保障的问题,研究者提出 Policy-Evidence-Execution Separation Pattern,并由 Trustworthy AI Posture(TAIP)Assurance Engine 以 Continuous Control Posture Assurance(CCPA)方式运行,将策略与稳定执行分离、把被采纳证据绑定到版本化 Posture Tree。该单主机测量仅覆盖对留存证据的保障,不含 RepoAudit 执行与模型推理。

  16. 论文追踪 · 收录 · 原文 论文43

    研究者提出多智能体系统输出与委派链路双层存证方案

    研究者提出一种面向多智能体系统的双层存证设计,用于在事故后回答两个问题:哪个部署方发布了被报告的字节,以及每条跨部署方边是否获得授权。该设计不依赖共享权威、公共日志或预先约定的工作流,由受信任的部署方运行时对每次发布输出的哈希签名,并以链路证据记录边的授权情况。在统一威胁模型下,作者比较了签名链表、Merkle 链变体和共同签名 DAG 三种方案:子密钥被攻破后,单签名设计允许未授权的父级绑定,而共同签名 DAG 因要求父级授权该边而拒绝该绑定。在 Apple M1 Pro 上,仅链路检查每跳耗时 24.3-499.2 微秒;在本地多服务工作流中,父级发现子级的 A2A Agent Card,子级调用 MCP 工具并发布本地 LLM 输出,30 个签名 DAG 任务全部通过完整验证,仅凭子密钥的受控声明被拒绝,平均端到端延迟 813.1ms,无证据时为 770.8ms。

  17. 论文追踪 · 收录 · 原文 论文38

    AgentKernel:面向 Agent 的可信原生操作系统内核

    研究者提出 AgentKernel,一个把安全作为首要设计约束的可信原生 Agent 操作系统,为身份、输入中介、记忆治理和执行控制提供强制且不可绕过的服务。作者认为现有治理方案仍是应用层中间件,与被监控的 Agent 共享同一进程信任边界,因此需要操作系统级底座。AgentKernel 将 Agent 生命周期包进强制执行边界,分为身份、感知、认知、执行四个支柱,分别应对委托滥用、提示注入、记忆投毒和工具误用。其中内核管理的身份支持跨组织协作,分级感知替代单点过滤,受信息流控制的记忆在限制投毒的同时提升检索保真度,语义到内核的执行机制让更宽的工具权限处于不可绕过边界之后。论文共 38 页、5 张图,通过系统比较与安全分析论证该架构可在整个 Agent 生命周期内实施安全约束。

  18. 论文追踪 · 收录 · 原文 论文42

    研究者提出零知识谓词证明网关,在 MCP 与 Agent2Agent 上实现 Agent 间数据最小化

    研究者提出 Zero-Knowledge Proof Gateway,让 AI 智能体之间交换治理定义谓词的证明而非原始数据,从设计上避免数据暴露,并针对现有互操作协议无法承载此类证明的问题,在同一端点上为 MCP 和 Agent2Agent 实现该插槽。32 位阈值谓词在单颗商用 vCPU 上证明耗时 6.2 ms、验证 1.0 ms,Bulletproofs 证明为 608 字节;11 项对抗实验与 19 项协议检查通过,系统部署到 Kubernetes 并经验证网络隔离。案例研究在不透露金额的前提下证明某零售客户订单在限额内,将 GDPR 数据最小化原则落实为技术措施。论文还指出谓词证明只把陈述绑定到已承诺的值、不绑定到记录系统,为此给出将 enclave 证明与证明双向融合的构造,使验证单个产物即可同时确认谓词成立且该值由特定已度量二进制读取,并在模拟权威机构上做了测试。

  19. 论文追踪 · 收录 · 原文 论文29

    面向安全 AI 渗透测试智能体:安全威胁、护栏与架构视角

    针对 LLM 驱动的自主渗透测试智能体,研究者系统分析了其智能体架构、信任边界与攻击面,提出覆盖 LLM 生命周期攻击、智能体架构攻击和跨领域行为攻击的威胁分类体系。研究指出,具备持久记忆、真实世界行动能力和长时程推理的渗透测试智能体带来不同于传统对话式 LLM 的安全隐患,现有对话 AI 护栏机制可能不足以保障其安全,并梳理了现有护栏的局限与关键研究空白,探讨面向下一代 AI 攻防系统的专用、上下文感知与架构感知护栏方向。

  20. 论文追踪 · 收录 · 原文 论文52

    AgentFlow:面向 LLM 智能体系统的流中心策略语言与运行时防护框架

    研究者提出 AgentFlow,一种以数据流为中心的策略语言与运行时执行模型,用于规定敏感数据在 LLM 智能体系统中可以流向何处。策略定义在带标签的运行时边上,约束哪些工具可接收敏感字段、哪些汇聚点可接收释放的数据,以及何种权限可跨越委派边界,语言支持流规则与路径规则、任务范围能力、受控释放和有状态污点语义。运行时参考监视器介入智能体动作,基于有界 SMT 的验证器对结构化策略片段检查安全属性。原型中七项安全属性每项在 0.5 秒内完成验证,验证器捕获研究中全部植入的不安全策略变体。在 AgentDojo 四个套件的 949 个注入案例上,确认失陷率从 33.0% 降至 0.0%,总体效用从 46.7% 升至 63.3%;在 200 例 AgentDyn Dailylife 基准上,确认失陷率从 73.5% 降至 0.0%,效用基本持平(44.5% 至 43.5%)。

  21. 论文追踪 · 收录 · 原文 论文55

    Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息,C-GEO Guard 将攻击成功率相对降低 47.6%

    清华大学深圳国际研究生院与香港大学的研究者提出 Counter-GEO-Bench,在受控条件下评测针对信息扭曲型生成引擎优化(GEO)的防御:247 条人工核验的查询各配信息保留与信息扭曲两种 GEO 改写,在 Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout 三个受害模型上测量攻击成功率、误报率和答案质量。Granite Guardian、Llama Guard 3 和 NeMo Self-Check 三种现成防御最多只把攻击成功率相对降低 5.7%,Granite Guardian 的降幅不具统计显著性,NeMo 在 Llama-4 上几乎拦下所有正常查询。作者认为这类护栏针对的是违规内容,而 GEO 虚假信息以流畅的信息性文本出现,能直接穿过。为说明这一威胁可以应对,作者给出轻量的片段级对比检测基线 C-GEO Guard,三个模型平均把攻击成功率相对降低 47.6%,答案质量几乎不受影响。

    推荐理由论文用配对改写设计量化了现有护栏对 GEO 虚假信息的失效程度,并给出可复现的检测基线。

10月3日周六
  1. 论文追踪 · 收录 · 原文 论文52

    ZoneClaw 用记忆分区防御 OpenClaw 式计算机使用 Agent 的持久记忆攻击

    研究者提出 ZoneClaw,通过把 OpenClaw 式计算机使用 Agent 的扁平工作区记忆改为带明确权限等级的分层信任区,切断持久化与权限之间的绑定,防御持久记忆攻击。这类攻击中,攻击者只需控制看似无害的外部内容,就能让 Agent 在正常任务中写入有利于攻击者的声明,这些声明随后会支配攻击者从未接触过的正常任务,攻击链从恶意上下文到恶意响应延伸为恶意上下文、记忆注入、恶意执行。ZoneClaw 让外部声明只停留在低信任区,只有跨过显式权限边界才能获得指导行动的权限,且提升时需与攻击者无法直接写入的信任区交叉校验,并通过非对称权限的角色专用进程保证没有进程同时摄取外部内容并对外行动。在四类攻击场景、两种注入设置和四个骨干模型上,ZoneClaw 将攻击成功率从 372/480 降至 6/480,同时在 458/480 次试验中保留实用性,并对部分具备防御感知的攻击者仍然有效。

  2. 论文追踪 · 收录 · 原文 论文38

    ReCast:在固定媒体接口下保护多模态推理的隐私框架

    研究者提出 ReCast,一个面向远程多模态推理的隐私保护框架,在保持图表和语音等固定输入模态的前提下替换源内容。它先在本地把输入转成统一的文本证据查询记录,用蒸馏的 4B 模型联合改写实体与主题,再通过本地可逆、角色感知的数值映射替换数值,由重建 Agent 生成并校验所需媒体;远程求解器返回的程序在本地还原受保护的操作数后再执行。在 4000 条 ChartQA 和 NMSQA 留出样本上,ReCast 准确率 75.10%,保留未受保护远程准确率的 92.43%,基于模型的审计在 7.95% 发往求解器的请求中标记出源内容泄露。作者称其优于所有评估的本地基线。

  3. 论文追踪 · 收录 · 原文 论文40

    SkillSentry:用自适应蜜罐世界动态检测 Agent 技能安全

    研究者提出 SkillSentry,一个基于自适应蜜罐世界的动态安全测试框架,用于检测 LLM Agent 外部技能在特定环境状态下才暴露的有害行为。该方法先推断技能的能力边界,构建由 LLM 模拟、含受控诱饵资源的环境,并自适应生成任务以探索其行为状态,再将启用技能的执行轨迹与匹配的无技能执行对比,把可疑行为定位到源码和已验证的执行轨迹上。在标准基准上,SkillSentry 取得 99.50% 召回率和 96.26% 平均 F1;在保持语义的规避攻击下平均 F1 为 92.95%,最强基线为 80.07%。作者称代码已公开。

  4. 论文追踪 · 收录 · 原文 论文47

    SingProbe 发布开源内在护栏框架,适配 29 个开源模型

    SingProbe 是一个面向 LLM 生成时监控的开源内在护栏框架,复用基座模型自回归解码中已产生的隐藏状态,而不是让独立模型反复处理生成文本。它用轻量探针在解码过程中持续输出查询意图、回复安全和幻觉风险信号,报告给出了训练方法、与 SGLang 和 vLLM 的服务集成,以及覆盖不同家族和规模的 29 个开源基座模型的适配护栏。团队同时提出 SingStreamBench,用于衡量流式护栏能否在良性前缀上保持静默并及时发现新出现的不安全内容。在安全、流式检测、幻觉检测、误报鲁棒性、在线监控和运行时开销等评测中,SingProbe 的表现与最先进的独立护栏和专用幻觉检测器相当,在若干设置下更强,实现中增加的服务开销低于 0.5%。除被动监控外,内在护栏信号还可引导受限解码,并在 SingProbe-Med 中选择性触发医疗风险干预。

  5. 论文追踪 · 收录 · 原文 论文35

    SPARED:用对抗编辑数据训练基于推理的 AI 生成图像检测器

    SPARED 是一个对抗强化学习框架,让扩散图像编辑器把真实照片改造成能骗过当前检测器的伪造版本,同时让推理 MLLM 学会给出带自由推理依据的判断。双方奖励均设计为无法走捷径:攻击方仅在编辑被忠实执行时得分,防御方仅在判断正确时得分。两模型交替迭代,每轮攻击方针对检测器盲点重建更难训练集,检测器在三个外部基准上逐轮单调提升,解释质量虽未被奖励也随轮次上升。

  6. 论文追踪 · 收录 · 原文 论文34

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    SafeEvolve 是一个经验驱动的智能体安全对齐自演化框架,通过已完成 on-policy 轨迹中的安全经验驱动 harness 与 policy 的持续协同演化。harness 侧将轨迹级安全证据转化为安全提示词与分层技能的有界组件级更新,policy 侧采用两阶段 SFT-RL 范式,用 harness 增强的 RL 与验证器分解奖励塑造多步探索中的自主安全行为。在 Qwen3.5-4B 上,SafeEvolve 在 AgentDojo 实现 ASR 降低 3 倍,同时将良性效用从 59.79% 提升至 61.86%。

  7. 论文追踪 · 收录 · 原文 论文52

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    研究者提出开源、框架无关的 Agent 运行时安全监督网关 ClawSentry,用于拦截被恶意第三方技能劫持的 Agent 行为。该方法把 Agent 风险分为技能准入、调用意图、执行效果和事后后果四个环节:执行前由 First-use Skill Package Review(FSPR)在确定性证据下限下审查技能包,未决案例升级到有界只读的 Agent 审查;运行时采用确定性 L1、规则锚定 L2 语义审查和只读 L3 取证 Agent 的三层渐进决策引擎,只对残余歧义投入上下文审查,并用会话级反绕过机制识别换工具与改写重试。事后路径将高严重度证据非回溯地送入后续审查。通过 Agent Harness Protocol(AHP)抽象,同一策略可应用于 Codex、Claude Code、Kimi CLI 和 Gemini CLI,无需修改 Agent 内部。

  8. 论文追踪 · 收录 · 原文 论文35

    SCOPE:训练有能力且安全的计算机使用智能体

    针对仅以任务成功为目标的训练无法让计算机使用智能体(CUA)形成可靠安全行为的问题,研究者提出 SCOPE,联合后训练任务执行能力与安全感知决策,并配套 SCOPE-Gen 自动生成可验证任务及其环境风险变体,构建含能力演示、安全续行与明确拒答的 SATraj-OS 轨迹数据集。以 Qwen3.5-9B 为起点,SCOPE-RL 在 OSWorld 上取得 54.17% 任务成功率、在 OS-BLIND 上取得 64.30% 攻击规避率,综合能力—安全得分 58.80%,为所评估智能体中最高。消融显示拒答轨迹贡献了大部分攻击规避增益,风险处理轨迹则在相近攻击规避水平下保留更高任务效用。

  9. 论文追踪 · 收录 · 原文 论文28

    生成图像更易被遗忘:面向合成图像检测的机器遗忘视角

    研究者提出把生成图像检测重构为机器遗忘问题:在大规模视觉模型(LVMs)的遗忘过程中,生成图像的特征退化速度快于自然图像,据此设计了无数据检测(剪枝模型参数诱发遗忘)和数据驱动检测(优化 LVMs 遗忘生成图像相关知识)两种方法。在多个基准上的实验显示,这种基于遗忘的方法优于传统检测方法。