跳到正文

防御与护栏

今天新收录 11 条(含旧文)
今天10月7日周三
  1. arXiv:可解释性 · 收录 · 原文 日期未知论文36

    针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估

    研究提出一个 2×2 纵深防御框架,将内部激活引导与外部记忆处理分离,在 MemSyco-Bench 上评估四种开放权重模型,涉及 10 个引导系数和五种记忆防御配置。其中三种配置为新设计:重写全部记忆、对每条记忆保留/重写/丢弃的 Router Gate,以及丢弃全部记忆。在 Llama 3.1 8B 上,Router Gate 配合轻度反向引导(α = -1.5)将评委平均谄媚率从 35.80% 降至 31.32%,平均准确率从 43.99% 变为 43.31%,但该下降在 149 个样本上不具统计显著性(配对 p = 0.08 至 0.63)。

  2. arXiv:危险能力与安全评测 · 收录 · 原文 日期未知论文41

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。作者发现路由 logits 对多模态输入是否安全具有很高的预测性。在 Qwen3-VL 和 Kimi-VL 上,该检测器显著降低了 HoliSafe 基准上的安全错误,并泛化到安全模式不同的分布外基准 MISHard 和 MM-SafetyBench。作者认为,相比通过提示、监督微调或路由专家引导来干预模型行为与内部状态,直接读取自然涌现的信号并接入外部安全机制,可作为现有安全干预的简单、有效且非侵入式的补充。

  3. 论文追踪 · 收录 · 原文 论文48

    AdvSim2Real 用任务与注入对手共同演化训练网页智能体

    AdvSim2Real 提出在冻结的网页世界模型中让任务课程、注入对手与智能体共同演化,以提升网页智能体对页面植入指令的鲁棒性。课程只奖励智能体约一半时间能解决的任务,对手只奖励能把判定成功翻转为失败的注入。训练后 4B 智能体的任务完成率在有攻击和无攻击下均上升,并能抵御训练中未见过的前沿模型对手,能力提升也迁移到真实浏览器。在 150 个网页任务上,面对这一未见对手,AdvSim2Real 相对基础智能体把完成率提升 33.6%。

  4. 论文追踪 · 收录 · 原文 论文46

    研究者提出 Staged Decoding 与 SFT 数据集,减少大推理模型推理轨迹中的隐私泄露

    研究者针对大推理模型(LRM)推理轨迹常含敏感信息、且可能被提示注入暴露的问题,提出把隐私指令当作可控性任务来处理。他们构建了一个 SFT 数据集,让模型在整个推理过程中遵循通用指令,并提出 Staged Decoding 解码策略,用独立的 LoRA 适配器分别生成推理轨迹和答案,以最大化各部分的指令遵循能力。在来自两个模型族的六个模型(1.7B 至 14B 参数)上,跨两个指令遵循基准和两个隐私基准评测,该方法在指令遵循上最高提升 20.9 分,在隐私基准上最高提升 51.9 个百分点,但可能因推理性能与指令遵循之间的权衡而损失任务效用。代码已公开,论文被 EMNLP 2026 主会接收。

  5. 论文追踪 · 收录 · 原文 论文55

    CoVer:用干预检验为 Agent 构造可判定规则边界

    论文提出 CoVer(corroborate-then-verify)方法,用于判断 Agent 执行的规则中哪些可由固定检查处理、哪些需要裁判。研究者在六个语料库(包括 EU AI Act、FINRA 指引和一个已部署的信贷 Agent)上,从三个实验室的四个模型收集约 2.2 万条标注,发现模型在答案明显时几乎完全一致,但在监管文本上分歧严重,且错误方向相反,无法把任一模型当作保守选择;在已部署 Agent 的规则集上,模型还会共同错误地声称固定检查足够,而这一方向永远不会被升级审核。CoVer 把模型一致视为提名,只有当为该谓词合成的检查能通过干预、读取 Agent 无法写入的字段并在确定性改写下保持成立时才接纳该谓词,从而拒绝大部分仅靠一致同意被错误接纳的谓词,代价是覆盖率的下降。

  6. Microsoft UFO · 收录 · 原文 日期未知27

    Microsoft UFO v3.0.9 发布

    Microsoft UFO 发布 v3.0.9,修复了 MSRC139482 和 MSRC138616 两个安全问题,涉及 ufo/client/mcp/http_servers/linux_mcp_server.py 与 ufo/utils/url_security.py、galaxy/webui/security 相关文件。同时将 GitHub Actions 固定到完整长度的 commit SHA。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. 论文追踪 · 收录 · 原文 论文44

    论文提出长程智能体自生子目标的运行时授权机制

    论文针对长程工具调用智能体在自生子目标、重规划和委派中可能超出主体授权任务的问题,提出一种运行时授权机制。每个目标图变更需携带版本绑定的见证,证明其延续轨迹、资源、义务、不变量和收束条件细化了当前根契约,受保护效果在原子提交边界重新校验,自由形式的目标文本不提供任何授权。作者在显式中介、抽象、新鲜性和原子性假设下证明了轨迹策略与建模禁止状态保持、条件性根成功保持、无记忆允许列表的分离结果、有限域可判定性以及可靠抽象细化下的通用安全单调性。可执行模型探索了 340 个状态和 419 次转移;在覆盖 25 种结构模式的 96 个匹配案例中,完整机制在 48 个漂移案例中零禁止状态提交,并完成全部 48 个良性对照。两条公开上游运行时路径在 32 个案例中执行 258 次原生调度,每个案例级决策与凭据链均匹配。

  8. Anthropic · 收录 · 原文 ↑753

    Anthropic 扩展 Cyber Verification Program,新增三级访问权限

    Anthropic 推出扩展版 Cyber Verification Program(CVP),将 Project Glasswing 与 CVP 整合为三级访问体系,向合格安全团队开放 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 等模型的高级网络能力并降低拦截分类器限制。三级分别为 Defense Access、Red Team Access 和 Specialized Access,其中 Specialized Access 拦截最少,仅限经美国政府协作深度审核的机构,可测试飞控系统、电网、电信网络等安全系统。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  9. Inspect · 收录 · 原文 33

    Inspect 支持任务与查看器将日志内容标记为不可信并以纯文本显示

    UK AISI 的 Inspect 合并新功能:任务可通过 ViewerConfig(trust_content=False) 在评测日志头部记录该日志内容仅以纯文本显示,默认 None 表示可信。eval_retry 重试时会保留上一次日志的 trust_content=False 及重新加载任务的查看器设置。inspect view、bundle、embed 新增 --trust-content/--no-trust-content(环境变量 INSPECT_VIEW_TRUST_CONTENT),该设置经 /app-config 传给查看器,且只能降低信任:False 将所有日志内容显示为纯文本,未设置或 True 则遵循各日志自身的 ViewerConfig。

  10. OpenAI · 收录 · 原文 50

    OpenAI 如何监控内部编码 Agent 的失准行为

    OpenAI 披露其内部编码 Agent 失准监控系统的运行方式与结果。该系统由 GPT-5.4 Thinking 以最高推理强度驱动,在交互完成后 30 分钟内审查完整对话历史、思维链和工具调用,对交互分类并标注严重等级,异常再交由人工复核。运行五个月、覆盖数千万条内部 Agent 编码轨迹,最高严重等级从未在真实对话中触发,仅在合成评测中出现;约 1000 条对话触发中等严重等级告警,其中不少来自内部红队测试,已升级至安全监督与安全事件响应团队。OpenAI 称监控系统覆盖了员工独立上报的全部交互,并发现更多原本未被注意的行为,同时指出模型在用户请求诱导下会过度绕开限制,但尚未发现自我保存或谋划等任务外动机。约不到 0.1% 的流量(主要来自定制或本地部署)暂不在监控范围内。

    推荐理由OpenAI 公开了内部编码 Agent 监控系统的运行数据与失效边界,为部署 Agent 的团队提供了一套可参照的监控设计思路。

10月6日周二
  1. 论文追踪 · 收录 · 原文 论文46

    论文提出可审计的文本水印合规方案以落实欧盟 AI 法案第 50 条

    针对欧盟 AI 法案第 50 条第 2 款要求生成式系统输出可机器读取和检测,论文提出一套可审计的替代方案。作者先定义描述长度鲁棒性剖面,用有限样本界说明可检测偏差会衰减、所需样本量随衰减率的平方反比增长,并以碰撞熵替代难以确定的 Shannon 熵常数。随后构建标签条件共形预测集,分别设定误归因与误排除水平,输出水印支持、不支持或不确定三种结论,覆盖率以有限样本结果给出并在可交换性下具备类条件性质。一个可复现的锦标赛水印小规模模拟验证了上述两点,并显示存活 token 规则把可容忍编辑率大约高估了一倍。论文据此提出上市前证书、签名检测报告和上市后重校准协议,用于落实欧盟委员会 2026 年行为准则,同时不主张水印具备普遍鲁棒性。

  2. 论文追踪 · 收录 · 原文 论文40

    研究者提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    研究者提出一种失败即关闭的临时可见性协议,用于控制持续摄入场景下 RAG 向量库的投毒暴露:新内容在截止期限内以临时状态准入,验证未及时完成的内容被隐藏,并支持按血缘范围隔离。在五组编码自然语言文档负载上,使用精确后端与 Milvus 评测,验证器积压时该截止机制把投毒检索的中位数从 34(29–34)降到 7(6–7),被挤出的干净结果数量同步下降。先验证后可见可避免临时暴露,但干净内容首次可见延迟到 6.3 秒,而临时准入可在 3 毫秒内可见,代价是过期干净条目可能出现临时可用性缺口。用特定检测器回放决策显示,误放行会让投毒内容保持可见,误拒答则会把干净内容排除在检索之外,说明协议保证与检测器质量各自决定哪些结果。该工作已被 IEEE CBDCom 2026 接收。

  3. Cloud Security Alliance(AI 相关) · 收录 · 原文 16

    用零信任微隔离保护 Agentic AI:风险分级与 agent-to-tool 策略

    云安全联盟提出用零信任微隔离约束 Agentic AI 工作负载,通过风险分级、agent-to-tool 策略、分层执行和持续验证,把受治理的出站流量变成智能体部署的前提。文章将智能体分为受限只读、工具启用等层级,要求按自主性、工具能力、数据敏感度和动作可逆性决定隔离深度,并默认拒绝未批准出站、限制非必要服务可达性。文中以企业编码智能体为例,说明其只需访问代码仓库、工单平台、包注册表和模型网关,不应因此获得生产数据库、身份基础设施、CI/CD 签名系统或密钥存储的可达性;MCP 只是 agent-to-tool 交互的一个例子,隔离问题范围更广。

  4. Tenet Security / GitHub · 收录 · 原文 日期未知43

    Tenet 开源 agent-jackstop,为 Cursor 和 Claude Code 加固以防御 Agentjacking

    Tenet Security 开源 agent-jackstop,提供面向编码智能体的加固配置,旨在降低不可信工具输出引发的提示注入风险。项目方强调网络出口控制、敏感数据访问限制及执行审批等运行时防护。相关防护效果属于项目方主张,不能仅凭配置发布视为已获得独立安全保证。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. ACL Anthology · 收录 · 原文 日期未知45

    Self-Reflection 提升大型推理模型安全性

    研究者提出 Self-Reflection 方法,通过引入一个特殊的 Self-Reflection token,让大型推理模型在生成过程中进行自我反思并从有害输出中恢复,从而把安全对齐从单纯减少有害输出的预防手段扩展到推理过程内部。该方法可无缝接入标准后训练流程,在提升安全性的同时也改善有用性。实验显示,采用 Self-Reflection 训练的模型将 HCR 从 13.8% 降至 4.1%,约为主流方法的三倍改进,并在有用性及安全与有用性的平衡上取得优势。在包括专门设计的自适应攻击在内的多种对抗攻击评测中,该机制在未做针对性对抗训练的情况下仍显著提升模型安全性。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  6. 论文追踪 · 收录 · 原文 论文54

    Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月

    据 Uber 团队自报,Uber 团队提出 ADR(Agentic AI Detection and Response)系统,用于防护通过 MCP 运行的 AI 智能体,由采集提示词、推理步骤与工具调用因果链的 ADR Sensor、预部署红队的 ADR Explorer 和两级在线检测的 ADR Detector 组成。该系统在 Uber 部署超过十个月,覆盖 7200 多台主机、每日处理逾 1 万次 Agent 会话,发现 26 类凭证泄露,并支撑一个精确率 97.2% 的凭证泄露拦截层。ADR-Bench 与 ADR Sensor 及检测框架源码已在 GitHub 公开。 上述部署规模及效果来自团队自身报告,并非独立验证结果。

    推荐理由Uber 团队公开了在 7200 台主机上运行十个月的 Agent 检测系统架构与 ADR-Bench 基准,可供企业搭建 MCP 安全监控时对照。

  7. arXiv · 收录 · 原文 日期未知论文25

    面向音频深度伪造检测的任务感知联合剪枝与蒸馏框架

    针对基于自监督学习(SSL)的音频深度伪造检测器参数量普遍超过 300M、难以部署到资源受限设备的问题,研究者提出任务感知联合剪枝与蒸馏框架,将跨域知识蒸馏与运动引导结构化剪枝结合,在激进压缩下保留伪造判别知识与关键结构。该框架把模型压缩至 31.9M 参数、FLOPs 降低 6.3 倍,在多个数据集上相比未压缩基线平均性能仅下降 1.30%。

  8. arXiv · 收录 · 原文 日期未知论文38

    AVCE:面向扩散模型可验证概念擦除的审计感知遗忘框架

    研究者提出 AVCE(Auditing-Aware Unlearning for Verifiable Concept Erasure in Diffusion Models),一种把概念擦除落到模型潜空间表征的遗忘框架。作者指出,多数擦除方法只在文本接口干预,通过提示词修改或文本条件权重的局部更新实现,并以给定提示词下的输出作为评估依据,而潜空间审计绕过文本条件直接探测去噪网络,显示被擦除概念仍可从内部表征中恢复,这一问题在抗对抗提示词的方法中同样存在,且随擦除概念数量增加而加剧。AVCE 审计每个概念的嵌入向量邻域,将发现的脆弱方向压缩为最弱几何点上的锚点,在该锚点以闭式解编辑交叉注意力和自注意力投影,再用路径级审计损失微调两条路径,并通过正交梯度投影整合多个概念。

  9. arXiv · 收录 · 原文 日期未知论文33

    Thrive:面向自回归 TTS 的抗重建攻击多比特语音水印框架

    针对自回归 TTS 合成语音在分发编辑中经历学习式重建后水印难以可靠恢复的问题,研究者提出多比特生成式语音水印框架 Thrive,覆盖离散 token 与连续表示两种生成范式。其 Rise 模块将水印注入中间表示并与后续生成同步,Care 模块按比特可靠性融合波形与频谱专家。实验显示 Thrive 在保持合成保真度的同时,于重建攻击下取得 87.6% 平均恢复准确率,并支持最多 10,000 个候选身份的来源归属。

  10. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文56

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    牛津大学等机构的研究者发现,为每个智能体单独部署 CaMeL 防护不足以保证多智能体系统安全:不可信数据跨越智能体边界后被下游智能体当作可信输入,从而劫持其控制流,作者将这一失效模式称为 boundary laundering,并构造了具体攻击。为此他们提出 multi-CaMeL,在智能体间通信中把可信自然语言指令与不可信数据分离到不同通道,并在运行时保留数据来源信息。在扩展 AgentDojo 得到的 MultiAgentDojo 基准上,multi-CaMeL 将攻击成功率从无防护的 12.9%、单智能体 CaMeL 的 0.2% 降至 0.0%;在 AssetOpsBench 上相对单智能体 CaMeL 平均仅增加 3.2 个百分点的效用损失,且模型能力越强损失越小。作者同时开源了 MultiAgentDojo 及 multi-CaMeL 实现。

    推荐理由论文给出多智能体系统中单智能体防护失效的具体攻击路径,并配套发布可复现的多智能体评测基准与防护实现。

  11. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文36

    SENTINEL:通过意图感知的输入-输出匹配防御 LLM 越狱

    研究者提出生成时越狱防御方法 SENTINEL,将防御重构为意图提取问题,利用指令微调 LLM 的输入-输出语义一致性,匹配语义对齐区域以提取暴露意图的子序列,并用拒答方向投影打分、必要时中止生成。在 HarmBench 上对多个 LLM 的实验中,SENTINEL 将越狱成功率降至接近 5%,同时保持较低的过度拒答,并对自适应攻击表现出鲁棒性。

  12. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文32

    无需目标答案的潜在空间安全对齐:无监督对抗训练提升 LLM 越狱鲁棒性

    针对现有对抗训练依赖固定有害目标或固定良性—有害数据对做定向激活消融、导致对抗样本行为单一的问题,研究者提出无目标对抗训练框架 Target-free Latent Safety Alignment,以无监督方式放大并多样化模型潜在空间中的行为级偏移,生成语义多样的对抗样本。该方法用语义熵作为输出层面的对抗行为多样性度量,在目标模型上诱发出多种有害行为,缓解行为窄化并提升对越狱攻击的鲁棒性。

  13. 论文追踪 · 收录 · 原文 论文40

    SRFT:让 Agent 从失败经验中自我反思以抵御提示注入

    研究者提出 Self-Reflection Fine-Tuning(SRFT)训练框架,让 LLM Agent 通过从自身在对抗条件下的失败经验中学习来提升鲁棒性。该方法不被动模仿专家行为,而是让 Agent 接触由注入攻击构造的被污染轨迹,再由专家模型生成结构化的自我反思推理,对比不安全动作与最优动作,从而学会识别恶意指令、推理其后果并保持与原始用户意图一致。作者基于 Llama-3.1-8B-Instruct 和 Qwen3-8B 构建了 SR-Agent,并在静态与自适应提示注入基准上评测,结果显示 SRFT 大幅降低攻击成功率,同时保持任务性能,在自适应攻击下也表现出较强泛化能力。代码已公开。

  14. Hugging Face Daily Papers · 收录 · 原文 论文32

    OmniConfess:用 Token 级「忏悔」缓解全模态幻觉

    研究提出免训练的 OmniConfess,通过固定候选回答、在受控的分通道证据干预下按 token 粒度重新打分,生成结构化的「token×通道忏悔」,从而定位回答依赖的证据,保留有依据内容、纠正由无关或矛盾证据驱动的表述。作者同时构建了 OmniHalluBench,由六个数据集组成、覆盖文本、图像、音频、视频及判断与自由生成,共 3,540 个样例;实验显示该方法在多种模态与任务设置下均能缓解幻觉,代码与基准已公开。

  15. 论文追踪 · 收录 · 原文 论文43

    RAISED:用自蒸馏抵御工具调用中的提示注入

    论文提出 RAISED(Robust Attack Invariance through Self-Distillation)训练框架,用于抵御工具调用型语言模型智能体面临的间接提示注入。作者指出,现有训练式防御会显著改变模型输出分布,在良性场景下也造成行为漂移,并存在一种失败模式:在良性工具使用任务中,模型会省略完成授权任务所需的步骤,尤其是该步骤由工具输出指示时。RAISED 先让模型自行生成工具使用场景,重点覆盖需要依据工具输出中的合法指引才能完成任务的情形,再通过自蒸馏让学生在同一轨迹的干净版本与注入版本上都对齐教师的干净上下文行为。论文称该方法大幅降低工具响应中提示注入的攻击成功率,且不同于此前的训练式防御,在智能体与通用基准上都能保持效用。

  16. arXiv:可解释性 · 收录 · 原文 日期未知论文33

    EmoRSS:缓解大语言模型由情绪引发的过度拒答

    研究发现情绪化表达会系统性提高大语言模型对良性请求的拒答倾向,造成不必要的过度拒答。为此提出的 EmoRSS 是一种激活引导方法:先用逐层线性探针定位拒答敏感层,并基于与探针方向对齐的稀疏自编码器(SAE)特征构建拒答子空间,再用同一查询的常规与情绪化请求对估计该子空间特征的平均激活偏移,将其解码为激活干预向量,在推理时沿反向拒答方向施加,且不更新主干参数。在两个大语言模型上的实验显示,当请求含情绪化表达时,EmoRSS 在拒答有害请求与回答良性请求之间取得了优于既有过度拒答缓解基线的权衡,同时更好地保留通用任务性能。

  17. Undercode News · 收录 · 原文 日期未知28

    Dify 1.17.1 收紧知识库安全并修复 RAG 抽取

    Dify 1.17.1 引入按数据集范围划分的知识库 API key,修复源文档抽取问题,并加固对不可信文档的处理。该版本还提示内置 Weaviate 需分阶段升级。上述内容来自 Undercode News 的二手报道,原始发布说明未被查阅。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月5日周一
  1. Hugging Face Daily Papers · 收录 · 原文 论文32

    FailBank:用运行时反馈自进化提升 VLA 模型任务成功率

    针对视觉-语言-动作(VLA)模型中运行时护栏只纠正单次动作、不改变底层策略的问题,研究者提出四阶段自进化框架 FailBank,把运行时反馈转化为持久的策略改进。在 VLA-Arena 基准的两个难度等级和两个 VLA 主干上,FailBank 相比基础策略将任务成功率提升 8.5 和 6.9 个百分点,策略引发的累计代价降低 35.6% 和 23.8%;相比运行时护栏,成功率提升 25.4 和 9.5 个百分点,累计代价相当。

  2. 论文追踪 · 收录 · 原文 论文46

    MIRROR:面向多智能体通信的法定人数完整性防御

    研究者提出 MIRROR,一种通信层完整性原语,用于防御 LLM 多智能体系统中的 Agent-in-the-Middle(AiTM)攻击。该方法将同一规范化载荷复制到 k 条逻辑路由,仅当严格多数路由报告相同摘要时才接受消息,其安全性来自诚实路由占多数的假设,而非密钥认证。作者在路由被攻陷比例 alpha < 0.5 下给出保证,并扩展到路由故障相关的情形,指出关键量是最大共享故障组规模而非路由数量;同时证明可用性与完整性在同一阈值退化,低于 alpha = 0.5 时法定人数拒绝和丢消息攻击者无法阻断诚实流量。该工作已被 NeurIPS 2026 FLMSec Workshop 接收。

  3. Goodfire · 收录 · 原文 28

    Goodfire 推出基于蛋白质模型嵌入向量的生物安全序列感知监控器

    Goodfire研究人员提出基于蛋白语言模型表征的序列风险监控器,用于生物研究智能体工作流中的双重用途筛查。他们在自建基准上发现,所测前沿模型的拒答主要受任务描述影响,对危险和良性序列的区分不足;序列监控器在被测改写、片段化和部分留出条件下优于序列比对筛查。作者报告该方法达到毫秒级处理,但重设计蛋白是否保留生物活性仅通过计算估计,未经实验验证。结果限定于被测序列与基准,不能视为全面生物安全保证。

  4. arXiv · 收录 · 原文 论文57

    Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作

    Pheo Inc 的 Rohit Taneja 等人提出 OATS(Open Agent Trust System),在 Agent 决定动作但尚未执行时做运行时治理,回答的是某个动作在当前机器和操作者策略下是否被允许,而非技能是否恶意。作者在 66,192 个公开 ClawHub 技能版本上测量发现,705 个被三个扫描器和注册表评审全部判为 clean 的技能,仍指示了 CIS Control 2.7 和 NIST SP 800-53 CM-11 列为禁止的动作,涉及 135 个发布者,其中单一发布者占 506 个;对 100 个样本的人工审计给出 92% 精确率(95% CI [84.8%, 96.5%])。OATS 的解析器不读技能文档、不调用模型,中位端到端耗时 67.6 ms,输出接入按(资源, 类别)计数的信任账本,升级阈值由操作者自述风险容忍度推导,而非固定十次干净批准。

    推荐理由论文把技能注册表审查与运行时动作治理拆成两个不同问题,并给出可复现的测量与开源实现,适合做 Agent 权限控制的团队参考。

  5. 论文追踪 · 收录 · 原文 论文41

    HASTE:用稀疏威胁证据自动演化 Agent 护栏以抵御新兴攻击

    HASTE 是一个多智能体框架,通过安全规范生成与攻击用例生成之间的对抗循环,从威胁报告和预印本中稀疏的描述或少量攻击样例出发,自动演化 Agent 护栏。安全规范引导护栏更新以修补已识别的安全漏洞,攻击用例则在每次更新后探测残余漏洞,评估结果反馈回两个过程,使护栏能应对初始证据之外的新兴攻击。在多种基座模型、攻击类型和证据形式上的实验显示,HASTE 持续降低攻击成功率,同时保持良性任务的效用。代码已公开。

  6. arXiv · 收录 · 原文 论文37

    RMCW:基于 Reed-Muller 码的抗删除 LLM 水印方法

    研究者提出 RMCW,一种基于 Reed-Muller 码的大语言模型水印方法,用于应对删除攻击导致的 token 位置偏移和水印对齐失效。生成阶段通过密钥化的词表划分把 Reed-Muller 结构注入文本序列;检测阶段将文本映射到密钥词表分箱,并用 Berlekamp-Welch 检验测试局部子序列的低次 Reed-Solomon 一致性,从而寻找存活的局部代数结构而非恢复全局码字。在 C4 和 ELI5 数据集、OPT-1.3B 与 Llama-3.1-8B-Instruct 上的实验显示,RMCW 保持较强的干净文本可检测性,并在多种删除与改写攻击下优于或持平基线方法。代码已开源于 https://github.com/BaichengDanny/RMCW。

  7. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文30

    Persona Guardrail:面向智能体系统的生产级防御框架

    作者提出 Persona Guardrail,通过基于智能体预定功能的输入输出校验限定其行为范围。摘要报告,在 PAGE 评测中,相较通用 LLM 护栏,整体准确率、域外检测率和误放行率均有改善。作者称该框架已用于生产部署并满足延迟预算;这些是论文摘要中的自报结果,本条没有独立复现,不能推及未测场景或普遍安全保证。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文33

    SecJev:为 System One 决策模型引入安全专业知识

    研究者提出 SecJev,据称是首个面向安全的 Jev 类决策模型家族,参数规模覆盖 0.8B 至 9B,基于 Kev 的单次候选打分器,从文本、遥测和观测历史中学习布尔、选择与有序决策。团队构建 SecJev-Corpus,统一 14 项任务、8 类来源的源标签预测与显式策略评估,覆盖工具输出、流量、联邦更新、共识、认证与车辆消息。安全专业化使家族中每个模型均有提升,SecJev-0.8B 在任务宏平均准确率上超过通用 Kev-9B 达 20.51 个百分点,并在提示注入与流量决策上复现增益,同时伴随依赖捕获的误报。

  9. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    论文提出在 Kubernetes 上保护 AI Agent 的七层纵深防御框架与参考架构

    论文主张不应把模型本身当作安全边界,Agent 在 Kubernetes 上的安全应作为基础设施问题处理,所有保证都需在 Agent 已被提示注入完全攻陷的假设下成立。作者提出十类威胁分类法(对齐 OWASP 智能体应用指南)、九条设计原则(核心是工具边界的完全中介,以及打破不可信输入、敏感访问与外部外发三者的组合)、七层纵深防御框架,并映射到工作负载身份、RBAC 与 ValidatingAdmissionPolicy、基于 SIG Apps Agent Sandbox 项目的 gVisor/Kata 沙箱、FQDN 感知的外发策略、带策略即代码的 Agent/MCP 网关与 eBPF 运行时执行等 Kubernetes 原生机制。作者未报告实测的攻击成功率或性能开销数据,而是列出残余风险和验证该框架所需的测量项。

  10. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文42

    研究提出基于收缩约束状态空间模型的有界可达性与越狱检测方法

    论文研究基于状态空间模型(SSM)的安全头何时能被认证为对嵌入空间有界扰动内的所有输入给出相同预测,证明关键在于状态转移矩阵的 l∞ 范数满足收缩条件(‖A‖∞<1),此时可对线性时不变分类器做精确区间界传播(IBP)认证。收缩条件成立时可达输出区间稳态宽度有界,样本可被认证为鲁棒分类;条件不成立时区间随序列长度指数增长,任何实际扰动半径下都无法认证。作者用 hinge 惩罚强制收缩,在有毒评论数据上把认证比例从 41% 提升到 59%,并在 ‖A‖∞=1 处观察到与理论一致的相变。将收缩正则化的 S4 头用于 JailbreakBench 越狱检测,零样本迁移到 AdvBench 的 DR=0.994、HarmBench 的 DR=0.988。

  11. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文44

    Whiteout:用混淆样本阻止 LLM 泄露个人敏感信息

    研究者提出 Whiteout,一种在个人提出请求后阻止 LLM 复述其真实个人敏感信息(PSI)的工具,做法是用精确设计的混淆样本覆盖这些信息。作者指出,现有基于机器遗忘的缓解方法往往删除过多信息、损害模型效用与安全性,且易受攻击。Whiteout 在多家厂商、不同规模的现代 LLM 上评估,其中包括一款广泛使用的 OpenAI 模型,结果显示它能有效阻止目标 PSI 被披露,对模型效用与安全性影响可忽略,并优于现有替代方案。研究还测试了 Whiteout 对黑盒攻击(如越狱)和白盒自适应攻击(如重学习、量化)等反制手段的鲁棒性,并讨论了其安全与伦理影响。