跳到正文

防御与护栏

今天新收录 21 条(含旧文)

第 3 页更新的内容回到最新

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文54

    研究:拒答只读取模型道德表征中的伤害切片

    一项针对四个开源权重模型的研究发现,拒答决策并不读取模型用于道德判断的完整道德子空间,而是只读取其中与伤害相关的低秩切片。作者在 OLMo-3 上用嵌套交换秩扫描做因果检验:随着道德基扩大,道德判断的迁移系数从 0.05 升到 0.66,而拒答迁移在 k=3 后停在 0.22 至 0.24,约四分之三的拒答因果输入落在道德子空间之外。研究还发现道德理解在预训练阶段就已形成,OLMo-3 上该子空间与最终状态的余弦从 1000 步的 0.869 升到 0.999,对齐只做一次约 40 度的旋转;而拒答门是后训练新建的,与其预训练前身的余弦仅 0.155。四个模型的读取方式并不一致:Llama-3.1 读取宽泛道德内容,Qwen2.5 超出单一伤害线索但在样本量下未定论,GPT-OSS 读取伤害且其拒答可被自身推理链推翻。

    推荐理由论文用嵌套交换干预追踪拒答决策读取的内容,给出拒答与道德判断在决策点近乎正交的机制解释。

  2. 论文追踪 · 收录 · 原文 论文53

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    研究者构建了覆盖十类政治敏感话题的 200 张图像基准,对 9 个视觉语言模型(7 个中国来源、2 个非中国来源)在四种提问范式和两种提示语言下运行 21708 次试验,由两个前沿 LLM 评审按六个维度逐条标注,并在 200 条样本上与三名人类专家验证。结果显示,中文提示下出现国家立场改写的几率约为英文提示的 3.67 倍,且在每个模型内部都成立;中国来源模型的改写率高于非中国模型,方向在两个评审和人类标注者间一致,幅度随评审不同在 1.6 至 3.2 倍之间。改写集中在文本提及敏感主体的条件下(36.5%),仅给图像时为 9.8%;在四代 Qwen 多模态模型上,显式拒答下降而国家立场改写上升,改写以替换和委婉语为主,且不含拒答关键词,关键词检测方法难以发现。

    推荐理由对 9 个视觉语言模型 21708 次试验的审计显示,审查正从可见的拒答转向难以察觉的改写,为多模态安全评测提供了新的测量维度。

  3. 论文追踪 · 收录 · 原文 论文50

    aiXamine:跨维度评测 LLM 安全、安全(security)与隐私权衡

    研究者提出 aiXamine,一个统一黑盒评测平台,把 LLM 的安全、安全(security)与隐私当作相互依赖的属性来评估。平台通过自动化红队流程编排 9 项服务上的 46 个测试,生成从提示词级诊断到跨服务权衡分析的分层风险画像,可在相同条件下复现对比闭源与开源权重系统。作者用 aiXamine 测试了 120 多个 LLM、超过 5000 次测试运行,发现三种单轴评测看不到的跨维度现象:更强的对齐会系统性提高过度拒答,形成可量化的安全税;隐私与其他可信维度近乎正交,标准对齐无法覆盖;无 on-policy 校正的 off-policy 知识蒸馏会导致熵坍缩,在同一基础架构上把鲁棒性从 56.9 降到 2.6。

  4. 论文追踪 · 收录 · 原文 论文58

    论文发现安全监控器主要拦截模型本就会拒答的请求

    Sripad Karne 的论文测量了安全监控器在目标模型实际会作答的请求上的召回率,发现四款文本护栏、两个激活探针和 Latent Guard 在 1% 假阳性率下,对模型会拒答请求的召回率是模型会作答请求的 1.1 到 6.4 倍,而 AUROC 多数仍在 0.85 以上,标准指标掩盖了这一差距。研究基于 647 条有害请求(来自 Aegis 2.0、HarmBench、StrongREJECT),每条改写成间接、直接、直白三个显式程度版本且意图经 LLM 与人工核验;Gemma-4-31B-IT 在直白版本只答 12 条,在间接版本答 340 条,相差 28 倍,其中 344 条翻转请求里各护栏漏放 153 到 321 条。作者把原因追溯到显式程度本身:模型与护栏内部的危害读数都随措辞变软而下降,沿显式方向对 Qwen3Guard 做激活引导可把标记率从 26% 推到 100%。

    推荐理由论文把监控器召回率按目标模型是否真的作答来切分,并给出措辞阶梯训练护栏的配方,做护栏评测与部署的团队可据此重设指标。

  5. 论文追踪 · 收录 · 原文 论文36

    CAVA:面向智能体 AI 运行时治理的规范动作验证与证明

    论文提出 CAVA(Canonical Action Verification and Attestation),一个运行时语义层,用于把本地编码钩子、SDK 工具、浏览器自动化、托管智能体轨迹、API 网关和工作流引擎等异构运行时中的智能体活动转换为规范运行时动作对象。CAVA 位于 Proof-Carrying Agent Actions(PCAA)之下,PCAA 定义部署方拥有的路线-审查-证明治理流程,CAVA 定义该流程所治理的稳定动作对象。论文形式化了规范动作身份、语义模式检测、审批绑定、回执完整性、运行时可移植投影和可选证明基底。作者通过一个 96 种子、384 变体的基准测试参考实现,覆盖语义等价、语义分离、包装器绕过、误报控制、审批绑定、回执可复现性、证明篡改检测、运行时可移植性、语义模式检测、策略退化和 Azure 部署演练。

  6. 论文追踪 · 收录 · 原文 论文35

    Janus:面向长时程智能体安全的前瞻性潜在风险预测框架

    研究者提出 Janus,一个面向长时程智能体安全的前瞻性框架,通过多智能体模拟合成多样化轨迹,训练护栏模型从部分轨迹中预判延迟风险。Janus 联合优化风险预判与安全裁决两项任务,采用 CoAA-RL 以预判对下游安全判断的效用作为奖励。所得护栏模型 Vanguard 可在动作执行前拦截不安全行为,在四个智能体安全基准上平均防护能力较基线护栏提升 15.9 个百分点,同时良性任务完成率提升 5.1 个百分点。

  7. 论文追踪 · 收录 · 原文 论文27

    拆解 LLM 交互中的隐私-效用权衡:Veilmind-4B 意图驱动本地保护框架

    研究系统分析了 LLM 交互中隐私清洗对下游性能的影响,揭示三项机制:数据价值随用户意图在关键约束与可弃噪声间切换、清洗方式(删除或替换)取决于任务对事实完整性还是结构连贯性的依赖、属性间存在协同依赖或对抗冗余的语义网络。据此提出意图驱动的本地保护框架,蒸馏轻量模型 Veilmind-4B 驱动动态提取-清洗-恢复流程,在保持低泄漏隐私点的同时,响应效用显著高于现有隐私基线,将隐私-效用权衡推向帕累托前沿。

  8. 论文追踪 · 收录 · 原文 论文36

    AgentRewind:面向长周期 LLM Agent 的可恢复执行框架

    研究者提出 AgentRewind,一个运行时恢复框架,通过记录 Agent 上下文与受控环境对齐的检查点,让 Agent 能回到较早状态并利用此前尝试的信息继续执行,以应对长周期任务中早期错误在上下文和环境状态中传播、后续动作难以逆转的问题。作者同时构建 MettleBench,用于评估包含一系列相关需求的长周期工程任务上的任务完成度与部分进展。在多种任务、多个模型、执行策略和 Agent harness 上的实验显示,AgentRewind 相比对比基线提升了任务成功率和平均清单进度。论文共 19 页、5 张图,发布于 arXiv(2608.14380)。

  9. 论文追踪 · 收录 · 原文 论文52

    Blindspot:面向长程工具调用 Agent 的安全与拒答校准基准

    研究者提出 Blindspot,一个针对长程工具调用 Agent 的轨迹级安全校准基准,通过自适应对抗交互、有状态工具执行和基于执行结果的判定来评估完整的用户—Agent—环境轨迹。当前版本包含 7 个领域的 22 类攻击和 35 个场景,生成超过 2500 条长程轨迹,平均交互长度 14.7 轮,每条轨迹被归为安全完成、正确拒答、不安全完成、过度拒答或不确定五类结果之一。与固定攻击数据集不同,Blindspot 是可扩展的实时仿真框架,攻击、场景、工具、策略、领域和 Agent 配置均可新增而无需重设计评测流程。

  10. 论文追踪 · 收录 · 原文 论文38

    FlowReview:以授权配对评测控制多智能体组合信息流

    研究者提出授权配对评测(authorization-paired evaluation),把拦截被禁止用途与完成必需授权用途设为同一成功标准,并给出 FlowReview 框架,串联对象解析、权限排序与确定性执行。在受控组合实验中,对组合产物进行审查把拒绝提交率从 86.0% 降到零,且未损失授权供给。作者据此指出,仅保留信息与来源血缘不足以确保正确的权限归属,对象身份与权限必须通过输出可验证的组件与执行保持连接,多智能体安全需要在治理组合信息流的同时保留使协作有价值的授权能力。论文共 44 页、9 张图,代码与数据已公开。

  11. 论文追踪 · 收录 · 原文 论文42

    ZeroGate:为受治理 AI Agent 运行时提供保留信任的快速路径

    Zexun Wang 提出 ZeroGate,把精确动作审批与持久化本地准入分离:签发方签署短时 ActionPass,受信任的运行时适配器在本地门检查绑定并消耗 nonce 前重建最终动作,并用 SQLite 事务把 nonce 消耗、配额更新与准入回执耦合在一起。论文给出条件性决策保持命题:在审批可靠、策略依赖完整且最新、观测忠实、消耗原子等前提下,本地准入成功意味着指定的同步策略会在准入点授权同一动作。作者强调实现本身不保证当前世界的新鲜性,也不保证远程效果恰好一次。评估包含语义夹具、并发与崩溃实验,以及 Azure Blob 上同步与准备式执行的对比:4800 次云端尝试中,准备式从 worker 准入到分发的 p95 为 9.802 至 11.374 ms,同步方式为 25.018 至 334.000 ms,但准备式的完整生命周期均值在各并发级别都更长,边界改善并非净加速。

  12. 论文追踪 · 收录 · 原文 论文41

    研究者构建中国AI生成内容合规基准,评测20个LLM

    研究者提出一套评估LLM是否符合中国AI生成内容合规要求的框架,并对20个知名模型给出评测结果。该框架包含2303个问题,覆盖六个维度,其中203个为自行构建的宪法类问题,由多个评判模型基于各自的分层对齐记忆独立给出裁决。结果显示,国际模型在使用标准中文问题时也表现出较高的合规水平,主要差异可能来自与意识形态对齐密切相关的维度。作者据此建立了一个监管基准,供全球AI社区在统一的法律依据下评测中外LLM。

  13. 论文追踪 · 收录 · 原文 论文56

    SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%

    加州大学伯克利分校研究者提出 SecOPD,用同策略蒸馏为防御微调提供 token 级反馈,替代 DPO、GRPO 等序列级信号。训练时学生模型在含注入的输入上生成 rollout,冻结的初始化模型在去掉注入的干净输入上为同一批 token 打分,与可信任务一致的 token 被鼓励、跟随注入的 token 被抑制。在 Qwen3.6-27B 上,面对 SoTA 自适应攻击 PISmith,SecOPD 的攻击成功率为 9.0%,此前 SoTA 的 Meta-SecAlign 为 94.0%,GRPO 为 61.2%;静态 SEP 攻击下 SecOPD 为 1.3%。在训练未见的 AgentDojo 工具调用场景,SecOPD 为 4.7%,Meta-SecAlign 为 5.5%,GRPO 为 0.7% 但效用降至 82.5%。代码与模型已开源。

    推荐理由论文给出 token 级反馈的防御微调配方,并报告在自适应攻击与工具调用场景下的 ASR 对比,可作防御方案选型参考。

  14. 论文追踪 · 收录 · 原文 论文53

    BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准

    研究者发布 BioSecBench-Refusal,一个用于评估生物研究任务风险识别与拒答行为的基准,将 61 个取自已发表文献的合法常规任务与 46 个看似真实研究但暗藏生物安全风险的虚构红队任务配对。在 16 种模型与框架组合中,常规任务的拒答率为 7% 至 74%,红队任务为 1% 至 62%,许多组合拒绝合法常规工作的比例与拒绝隐藏风险相当甚至更高。拒答最常由智能体推理之前生效的提供商 API 过滤器触发,而获得推理空间的模型表现出识别更多真实威胁的潜力。作者将该基准作为工具发布,供模型开发者校准智能体生物技术研发的能力与审慎程度。

  15. 论文追踪 · 收录 · 原文 论文40

    ActionGuard:在工具调用执行前拦截被投毒技能

    研究者提出 ActionGuard,在技能影响的工具调用即将执行前进行授权检查,以阻止被投毒技能诱导的数据外泄、文件删除或未授权代码执行。该方法把目标智能体的动作生成上下文与护栏的授权上下文分离,Reviewer 不接触可能被投毒的原始技能文本,而是依据平衡后的技能画像、当前及近期工具调用和本地脚本内容,判断每个动作是否由可信用户请求所支持。ActionGuard 在 OpenClaw 的 before-tool-call 阶段拦截每次工具调用,并以 fail-closed 策略执行 ALLOW 或 DENY 决定。在 SKILL-INJECT 设置下,针对 139 个上下文注入和 180 个明显注入,使用三个开源和两个商用 Reviewer 模型与 Dynamic Guardian、SkillGuard 对比,每种条件重复三次,以攻击成功率(ASR)和任务成功率(TSR)评估。

  16. 论文追踪 · 收录 · 原文 论文29

    面向软件交付决策门禁的智能体安全审计器持续保障机制

    针对基于 LLM 的仓库审计器在 CI 流水线中作为安全控制时因非确定性行为和策略变化难以维持即时保障的问题,研究者提出 Policy-Evidence-Execution Separation Pattern,并由 Trustworthy AI Posture(TAIP)Assurance Engine 以 Continuous Control Posture Assurance(CCPA)方式运行,将策略与稳定执行分离、把被采纳证据绑定到版本化 Posture Tree。该单主机测量仅覆盖对留存证据的保障,不含 RepoAudit 执行与模型推理。

  17. 论文追踪 · 收录 · 原文 论文43

    研究者提出多智能体系统输出与委派链路双层存证方案

    研究者提出一种面向多智能体系统的双层存证设计,用于在事故后回答两个问题:哪个部署方发布了被报告的字节,以及每条跨部署方边是否获得授权。该设计不依赖共享权威、公共日志或预先约定的工作流,由受信任的部署方运行时对每次发布输出的哈希签名,并以链路证据记录边的授权情况。在统一威胁模型下,作者比较了签名链表、Merkle 链变体和共同签名 DAG 三种方案:子密钥被攻破后,单签名设计允许未授权的父级绑定,而共同签名 DAG 因要求父级授权该边而拒绝该绑定。在 Apple M1 Pro 上,仅链路检查每跳耗时 24.3-499.2 微秒;在本地多服务工作流中,父级发现子级的 A2A Agent Card,子级调用 MCP 工具并发布本地 LLM 输出,30 个签名 DAG 任务全部通过完整验证,仅凭子密钥的受控声明被拒绝,平均端到端延迟 813.1ms,无证据时为 770.8ms。

  18. 论文追踪 · 收录 · 原文 论文38

    AgentKernel:面向 Agent 的可信原生操作系统内核

    研究者提出 AgentKernel,一个把安全作为首要设计约束的可信原生 Agent 操作系统,为身份、输入中介、记忆治理和执行控制提供强制且不可绕过的服务。作者认为现有治理方案仍是应用层中间件,与被监控的 Agent 共享同一进程信任边界,因此需要操作系统级底座。AgentKernel 将 Agent 生命周期包进强制执行边界,分为身份、感知、认知、执行四个支柱,分别应对委托滥用、提示注入、记忆投毒和工具误用。其中内核管理的身份支持跨组织协作,分级感知替代单点过滤,受信息流控制的记忆在限制投毒的同时提升检索保真度,语义到内核的执行机制让更宽的工具权限处于不可绕过边界之后。论文共 38 页、5 张图,通过系统比较与安全分析论证该架构可在整个 Agent 生命周期内实施安全约束。

  19. 论文追踪 · 收录 · 原文 论文42

    研究者提出零知识谓词证明网关,在 MCP 与 Agent2Agent 上实现 Agent 间数据最小化

    研究者提出 Zero-Knowledge Proof Gateway,让 AI 智能体之间交换治理定义谓词的证明而非原始数据,从设计上避免数据暴露,并针对现有互操作协议无法承载此类证明的问题,在同一端点上为 MCP 和 Agent2Agent 实现该插槽。32 位阈值谓词在单颗商用 vCPU 上证明耗时 6.2 ms、验证 1.0 ms,Bulletproofs 证明为 608 字节;11 项对抗实验与 19 项协议检查通过,系统部署到 Kubernetes 并经验证网络隔离。案例研究在不透露金额的前提下证明某零售客户订单在限额内,将 GDPR 数据最小化原则落实为技术措施。论文还指出谓词证明只把陈述绑定到已承诺的值、不绑定到记录系统,为此给出将 enclave 证明与证明双向融合的构造,使验证单个产物即可同时确认谓词成立且该值由特定已度量二进制读取,并在模拟权威机构上做了测试。

  20. 论文追踪 · 收录 · 原文 论文29

    面向安全 AI 渗透测试智能体:安全威胁、护栏与架构视角

    针对 LLM 驱动的自主渗透测试智能体,研究者系统分析了其智能体架构、信任边界与攻击面,提出覆盖 LLM 生命周期攻击、智能体架构攻击和跨领域行为攻击的威胁分类体系。研究指出,具备持久记忆、真实世界行动能力和长时程推理的渗透测试智能体带来不同于传统对话式 LLM 的安全隐患,现有对话 AI 护栏机制可能不足以保障其安全,并梳理了现有护栏的局限与关键研究空白,探讨面向下一代 AI 攻防系统的专用、上下文感知与架构感知护栏方向。

  21. 论文追踪 · 收录 · 原文 论文52

    AgentFlow:面向 LLM 智能体系统的流中心策略语言与运行时防护框架

    研究者提出 AgentFlow,一种以数据流为中心的策略语言与运行时执行模型,用于规定敏感数据在 LLM 智能体系统中可以流向何处。策略定义在带标签的运行时边上,约束哪些工具可接收敏感字段、哪些汇聚点可接收释放的数据,以及何种权限可跨越委派边界,语言支持流规则与路径规则、任务范围能力、受控释放和有状态污点语义。运行时参考监视器介入智能体动作,基于有界 SMT 的验证器对结构化策略片段检查安全属性。原型中七项安全属性每项在 0.5 秒内完成验证,验证器捕获研究中全部植入的不安全策略变体。在 AgentDojo 四个套件的 949 个注入案例上,确认失陷率从 33.0% 降至 0.0%,总体效用从 46.7% 升至 63.3%;在 200 例 AgentDyn Dailylife 基准上,确认失陷率从 73.5% 降至 0.0%,效用基本持平(44.5% 至 43.5%)。

  22. 论文追踪 · 收录 · 原文 论文55

    Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息,C-GEO Guard 将攻击成功率相对降低 47.6%

    清华大学深圳国际研究生院与香港大学的研究者提出 Counter-GEO-Bench,在受控条件下评测针对信息扭曲型生成引擎优化(GEO)的防御:247 条人工核验的查询各配信息保留与信息扭曲两种 GEO 改写,在 Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout 三个受害模型上测量攻击成功率、误报率和答案质量。Granite Guardian、Llama Guard 3 和 NeMo Self-Check 三种现成防御最多只把攻击成功率相对降低 5.7%,Granite Guardian 的降幅不具统计显著性,NeMo 在 Llama-4 上几乎拦下所有正常查询。作者认为这类护栏针对的是违规内容,而 GEO 虚假信息以流畅的信息性文本出现,能直接穿过。为说明这一威胁可以应对,作者给出轻量的片段级对比检测基线 C-GEO Guard,三个模型平均把攻击成功率相对降低 47.6%,答案质量几乎不受影响。

    推荐理由论文用配对改写设计量化了现有护栏对 GEO 虚假信息的失效程度,并给出可复现的检测基线。

10月3日周六
  1. 论文追踪 · 收录 · 原文 论文52

    ZoneClaw 用记忆分区防御 OpenClaw 式计算机使用 Agent 的持久记忆攻击

    研究者提出 ZoneClaw,通过把 OpenClaw 式计算机使用 Agent 的扁平工作区记忆改为带明确权限等级的分层信任区,切断持久化与权限之间的绑定,防御持久记忆攻击。这类攻击中,攻击者只需控制看似无害的外部内容,就能让 Agent 在正常任务中写入有利于攻击者的声明,这些声明随后会支配攻击者从未接触过的正常任务,攻击链从恶意上下文到恶意响应延伸为恶意上下文、记忆注入、恶意执行。ZoneClaw 让外部声明只停留在低信任区,只有跨过显式权限边界才能获得指导行动的权限,且提升时需与攻击者无法直接写入的信任区交叉校验,并通过非对称权限的角色专用进程保证没有进程同时摄取外部内容并对外行动。在四类攻击场景、两种注入设置和四个骨干模型上,ZoneClaw 将攻击成功率从 372/480 降至 6/480,同时在 458/480 次试验中保留实用性,并对部分具备防御感知的攻击者仍然有效。

  2. Jonas Geiping · 收录 · 原文 50

    研究者用探针训练对齐模型,让模型学会无害而非拒答

    Jonas Geiping 等人发布预印本,提出直接针对无害性与诚实性探针优化模型,并称在持续更新探针的前提下效果良好,模型学会对有害请求生成无害回答、在压力下保持诚实。作者转述的论文观点认为,AI 安全领域不少被视为禁忌的技术(如用思维链检测奖励作弊、用模型内部表征做训练)缺乏清晰科学依据,而随着未来模型可能靠通用奖励寻求行为刷满对齐训练场景,用内部表征监督训练且不丧失可监控性将愈发重要。作者本人指出,这种训练让模型学会无害,而不是学会拒答有害请求,小模型在被诱导输出有害内容时会出现一些有意思的回答。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. 论文追踪 · 收录 · 原文 论文38

    ReCast:在固定媒体接口下保护多模态推理的隐私框架

    研究者提出 ReCast,一个面向远程多模态推理的隐私保护框架,在保持图表和语音等固定输入模态的前提下替换源内容。它先在本地把输入转成统一的文本证据查询记录,用蒸馏的 4B 模型联合改写实体与主题,再通过本地可逆、角色感知的数值映射替换数值,由重建 Agent 生成并校验所需媒体;远程求解器返回的程序在本地还原受保护的操作数后再执行。在 4000 条 ChartQA 和 NMSQA 留出样本上,ReCast 准确率 75.10%,保留未受保护远程准确率的 92.43%,基于模型的审计在 7.95% 发往求解器的请求中标记出源内容泄露。作者称其优于所有评估的本地基线。

  4. 论文追踪 · 收录 · 原文 论文40

    SkillSentry:用自适应蜜罐世界动态检测 Agent 技能安全

    研究者提出 SkillSentry,一个基于自适应蜜罐世界的动态安全测试框架,用于检测 LLM Agent 外部技能在特定环境状态下才暴露的有害行为。该方法先推断技能的能力边界,构建由 LLM 模拟、含受控诱饵资源的环境,并自适应生成任务以探索其行为状态,再将启用技能的执行轨迹与匹配的无技能执行对比,把可疑行为定位到源码和已验证的执行轨迹上。在标准基准上,SkillSentry 取得 99.50% 召回率和 96.26% 平均 F1;在保持语义的规避攻击下平均 F1 为 92.95%,最强基线为 80.07%。作者称代码已公开。

  5. 论文追踪 · 收录 · 原文 论文47

    SingProbe 发布开源内在护栏框架,适配 29 个开源模型

    SingProbe 是一个面向 LLM 生成时监控的开源内在护栏框架,复用基座模型自回归解码中已产生的隐藏状态,而不是让独立模型反复处理生成文本。它用轻量探针在解码过程中持续输出查询意图、回复安全和幻觉风险信号,报告给出了训练方法、与 SGLang 和 vLLM 的服务集成,以及覆盖不同家族和规模的 29 个开源基座模型的适配护栏。团队同时提出 SingStreamBench,用于衡量流式护栏能否在良性前缀上保持静默并及时发现新出现的不安全内容。在安全、流式检测、幻觉检测、误报鲁棒性、在线监控和运行时开销等评测中,SingProbe 的表现与最先进的独立护栏和专用幻觉检测器相当,在若干设置下更强,实现中增加的服务开销低于 0.5%。除被动监控外,内在护栏信号还可引导受限解码,并在 SingProbe-Med 中选择性触发医疗风险干预。

  6. 论文追踪 · 收录 · 原文 论文40

    研究分析 Be My Eyes 1428 条低分评论,揭示视觉描述服务的骚扰、隐私与无障碍安全问题

    Brigham 与 Kohno 对 Be My Eyes 的 1428 条一至三星评论做定性分析,考察这一连接超百万盲人与低视力用户、超千万志愿者的视觉描述服务及其 AI 版本 Be My AI 中用户和志愿者遇到的问题。分析发现三类问题:网络骚扰与滥用(恶意骚扰、网络裸露、举报机制失效)、信息暴露之外的隐私担忧(数据被用于模型训练),以及无障碍与安全问题(描述不准确、家长式护栏)。研究还分析平台政策是否及如何回应这些问题,并针对无障碍、安全、隐私与 AI 方面的挑战提出改进视觉描述服务信任与安全的建议。

  7. 论文追踪 · 收录 · 原文 论文35

    SPARED:用对抗编辑数据训练基于推理的 AI 生成图像检测器

    SPARED 是一个对抗强化学习框架,让扩散图像编辑器把真实照片改造成能骗过当前检测器的伪造版本,同时让推理 MLLM 学会给出带自由推理依据的判断。双方奖励均设计为无法走捷径:攻击方仅在编辑被忠实执行时得分,防御方仅在判断正确时得分。两模型交替迭代,每轮攻击方针对检测器盲点重建更难训练集,检测器在三个外部基准上逐轮单调提升,解释质量虽未被奖励也随轮次上升。

  8. 论文追踪 · 收录 · 原文 论文34

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    SafeEvolve 是一个经验驱动的智能体安全对齐自演化框架,通过已完成 on-policy 轨迹中的安全经验驱动 harness 与 policy 的持续协同演化。harness 侧将轨迹级安全证据转化为安全提示词与分层技能的有界组件级更新,policy 侧采用两阶段 SFT-RL 范式,用 harness 增强的 RL 与验证器分解奖励塑造多步探索中的自主安全行为。在 Qwen3.5-4B 上,SafeEvolve 在 AgentDojo 实现 ASR 降低 3 倍,同时将良性效用从 59.79% 提升至 61.86%。

  9. 论文追踪 · 收录 · 原文 论文52

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    研究者提出开源、框架无关的 Agent 运行时安全监督网关 ClawSentry,用于拦截被恶意第三方技能劫持的 Agent 行为。该方法把 Agent 风险分为技能准入、调用意图、执行效果和事后后果四个环节:执行前由 First-use Skill Package Review(FSPR)在确定性证据下限下审查技能包,未决案例升级到有界只读的 Agent 审查;运行时采用确定性 L1、规则锚定 L2 语义审查和只读 L3 取证 Agent 的三层渐进决策引擎,只对残余歧义投入上下文审查,并用会话级反绕过机制识别换工具与改写重试。事后路径将高严重度证据非回溯地送入后续审查。通过 Agent Harness Protocol(AHP)抽象,同一策略可应用于 Codex、Claude Code、Kimi CLI 和 Gemini CLI,无需修改 Agent 内部。

  10. 论文追踪 · 收录 · 原文 论文35

    SCOPE:训练有能力且安全的计算机使用智能体

    针对仅以任务成功为目标的训练无法让计算机使用智能体(CUA)形成可靠安全行为的问题,研究者提出 SCOPE,联合后训练任务执行能力与安全感知决策,并配套 SCOPE-Gen 自动生成可验证任务及其环境风险变体,构建含能力演示、安全续行与明确拒答的 SATraj-OS 轨迹数据集。以 Qwen3.5-9B 为起点,SCOPE-RL 在 OSWorld 上取得 54.17% 任务成功率、在 OS-BLIND 上取得 64.30% 攻击规避率,综合能力—安全得分 58.80%,为所评估智能体中最高。消融显示拒答轨迹贡献了大部分攻击规避增益,风险处理轨迹则在相近攻击规避水平下保留更高任务效用。

  11. 论文追踪 · 收录 · 原文 论文28

    生成图像更易被遗忘:面向合成图像检测的机器遗忘视角

    研究者提出把生成图像检测重构为机器遗忘问题:在大规模视觉模型(LVMs)的遗忘过程中,生成图像的特征退化速度快于自然图像,据此设计了无数据检测(剪枝模型参数诱发遗忘)和数据驱动检测(优化 LVMs 遗忘生成图像相关知识)两种方法。在多个基准上的实验显示,这种基于遗忘的方法优于传统检测方法。

  12. 论文追踪 · 收录 · 原文 论文38

    GeoDetect:面向视觉语言预训练模型的几何对抗检测方法

    研究者提出 GeoDetect,一种针对视觉语言预训练模型(VLP)的对抗样本检测方法。他们分析 VLP 嵌入空间的几何结构,发现其存在不同于单模态视觉模型的各向异性,理论分析表明对抗攻击会增大干净样本与对抗样本之间的几何间隔,对抗样本到随机采样点的期望距离更大,倾向于把表示推出流形区域。GeoDetect 利用这种偏离流形的几何分数识别对抗样本。评估显示该方法在多种 VLP 架构和威胁场景下都能可靠检测对抗样本,覆盖单模态与多模态攻击以及自适应攻击。该工作已被 ECCV 2026 接收。

  13. 论文追踪 · 收录 · 原文 论文36

    PACE:为 DeFi 中的 AI Agent 提供策略认证的合约执行框架

    研究者提出 PACE(Policy-Attested Contract Execution),一个插入在基于 LLM 的 Agent 与链上执行之间的交易级授权框架,用于应对 Agent 继承的提示注入风险以及审批无法绑定到最终上链交易的问题。PACE 引入类型化交易意图、确定性策略验证器和签名的 Policy Decision Records(PDR),将获批意图、策略与模拟报告加密绑定到确切的执行字节,并提供重放与过期保护;Solidity 智能账户在链上强制校验 PDR 签名,实测开销为 29,826-31,822 gas。作者将结论限定为可复现基准内的逻辑层安全,而非可直接部署的 DeFi 安全方案。

  14. 论文追踪 · 收录 · 原文 论文50

    WebMCP-Phalanx:为浏览器内 LLM Agent 工具调用建立信任边界

    研究者提出 WebMCP-Phalanx,一种面向 W3C WebMCP 浏览器内 LLM Agent 工具调用的双层运行时架构,用于补足同源策略在工具来源与生命周期上的不足。第一层以浏览器原生信任锚,通过加密保护的能力凭证把每个工具绑定到注册主体,并在工具生命周期内传播来源标签;第二层把语义检查与特权工具使用分离,无工具调用权限的隔离 Agent(Q-LLM)检查工具元数据、输出和页面内容中的提示注入,通过验证的内容再交给特权 Agent(P-LLM)执行,Q-LLM 内部状态对页面脚本不可见。实验显示,浏览器原生归属机制把撤销与覆写攻击成功率从 100% 降到 0%;双 Agent 运行时拦截了工具描述中嵌入的全部 80 次提示注入尝试,并把工具返回攻击限制在 80 次中的 2 次成功,任务效用与无攻击基线在统计上无差异。

  15. 论文追踪 · 收录 · 原文 论文50

    SkillGuard:面向间接提示注入的 LLM Agent 能力限制机制

    研究者提出 SkillGuard,一种 harness 层的执行约束机制,用于应对 LLM Agent 在间接提示注入下把外部技能输出带入执行上下文的问题。该方法把不可信数据进入状态视为污染事件,用 Skill Impact Graph 表示安全相关状态转移,用 steerability signatures 规定技能参数的可接受控制范围,并通过内联引用监视器介入技能调用;污染发生后按二值、分数或分数流策略计算加权能力限制,且不依赖额外的语言模型推理。分数流限制在相同攻击成功率下比二值限制保留更多能力,两种设置下均不增加模型调用或 token 开销。

  16. OWASP AI Exchange · 收录 · 原文 43

    OWASP AI Exchange 指南补充流式输出跨分块敏感信息过滤方法

    OWASP AI Exchange 项目在 AI 安全与隐私指南的敏感输出处理章节新增一条实现要点,指出当模型输出按 token 等分块流式返回时,敏感值可能被拆到两个或多个分块中,导致任何单块都不匹配。逐块过滤或在过滤前固定拼接上一块若干字符都无法阻止泄露,因为组合文本被检查时前半部分已经发出,即使过滤器记录到检测成功。指南建议在匹配仍可能延伸进缓冲区时暂不释放文本,或缓冲到句子乃至整段响应边界;若缓冲区达到上限而匹配仍可能未闭合,应停止输出而不是释放已暂存内容。文中给出的测试判据是,对同一文本的每一种分块方式,流式输出都应等于一次性过滤整段文本的结果。

  17. 论文追踪 · 收录 · 原文 论文46

    UCM:为网页智能体遮蔽不可信内容以提供安全保证

    研究者提出 Untrusted Content Masking(UCM),一种为网页智能体恢复可信与不可信内容边界的防御方法,用于抵御提示注入攻击。该方法利用网页 DOM 结构足以区分可信与不可信区域这一特性,在不可信内容到达智能体前将其遮蔽,并通过带严格权限隔离的沙箱接口完成交互,使智能体在观察和操作环境的同时与对抗性内容隔离。作者称该方法简单有效,代码已公开。论文作者包括 Kristina Nikolić、Egor Zverev、Javier Rando、Matthew Jagielski、Edoardo Debenedetti、Florian Tramèr。

  18. 论文追踪 · 收录 · 原文 论文34

    AUDITPLAN:先提交安全计划再作答的可审计安全对齐方法

    AUDITPLAN 让模型先输出包含威胁标签、预期动作和显式约束的结构化安全计划,再据此作答,计划对用户隐藏但可机器审计。该方法用监督微调加 FAITHGATE 奖励门控强化学习训练,仅在安全计划正确时才给予答案奖励。在 Qwen2.5-3B-Instruct 上,ASR 从 24.0% 降至 11.6%,LSR 从 1.0% 降至 0.36%,过度拒答从 11.0% 降至 2.0%,Qwen2.5-1.5B-Instruct、Qwen-3-4B-Instruct 和 Qwen2.5-7B-Instruct 上趋势一致。