跳到正文

防御与护栏

安全训练、护栏、安全分类器与拒答策略,以及它们在自适应攻击下的表现。

414条动态与论文相关主题越狱与攻击安全评测工具与开源
在这个话题内搜索或按分类筛选

新闻与论文

第 101–120 条 · 共 414 条
10月3日周六
  1. 论文追踪 · 收录 · 原文 论文40

    SkillSentry:用自适应蜜罐世界动态检测 Agent 技能安全

    研究者提出 SkillSentry,一个基于自适应蜜罐世界的动态安全测试框架,用于检测 LLM Agent 外部技能在特定环境状态下才暴露的有害行为。该方法先推断技能的能力边界,构建由 LLM 模拟、含受控诱饵资源的环境,并自适应生成任务以探索其行为状态,再将启用技能的执行轨迹与匹配的无技能执行对比,把可疑行为定位到源码和已验证的执行轨迹上。在标准基准上,SkillSentry 取得 99.50% 召回率和 96.26% 平均 F1;在保持语义的规避攻击下平均 F1 为 92.95%,最强基线为 80.07%。作者称代码已公开。

  2. 论文追踪 · 收录 · 原文 论文47

    SingProbe 发布开源内在护栏框架,适配 29 个开源模型

    SingProbe 是一个面向 LLM 生成时监控的开源内在护栏框架,复用基座模型自回归解码中已产生的隐藏状态,而不是让独立模型反复处理生成文本。它用轻量探针在解码过程中持续输出查询意图、回复安全和幻觉风险信号,报告给出了训练方法、与 SGLang 和 vLLM 的服务集成,以及覆盖不同家族和规模的 29 个开源基座模型的适配护栏。团队同时提出 SingStreamBench,用于衡量流式护栏能否在良性前缀上保持静默并及时发现新出现的不安全内容。在安全、流式检测、幻觉检测、误报鲁棒性、在线监控和运行时开销等评测中,SingProbe 的表现与最先进的独立护栏和专用幻觉检测器相当,在若干设置下更强,实现中增加的服务开销低于 0.5%。除被动监控外,内在护栏信号还可引导受限解码,并在 SingProbe-Med 中选择性触发医疗风险干预。

  3. 论文追踪 · 收录 · 原文 论文40

    研究分析 Be My Eyes 1428 条低分评论,揭示视觉描述服务的骚扰、隐私与无障碍安全问题

    Brigham 与 Kohno 对 Be My Eyes 的 1428 条一至三星评论做定性分析,考察这一连接超百万盲人与低视力用户、超千万志愿者的视觉描述服务及其 AI 版本 Be My AI 中用户和志愿者遇到的问题。分析发现三类问题:网络骚扰与滥用(恶意骚扰、网络裸露、举报机制失效)、信息暴露之外的隐私担忧(数据被用于模型训练),以及无障碍与安全问题(描述不准确、家长式护栏)。研究还分析平台政策是否及如何回应这些问题,并针对无障碍、安全、隐私与 AI 方面的挑战提出改进视觉描述服务信任与安全的建议。

  4. 论文追踪 · 收录 · 原文 论文35

    SPARED:用对抗编辑数据训练基于推理的 AI 生成图像检测器

    SPARED 是一个对抗强化学习框架,让扩散图像编辑器把真实照片改造成能骗过当前检测器的伪造版本,同时让推理 MLLM 学会给出带自由推理依据的判断。双方奖励均设计为无法走捷径:攻击方仅在编辑被忠实执行时得分,防御方仅在判断正确时得分。两模型交替迭代,每轮攻击方针对检测器盲点重建更难训练集,检测器在三个外部基准上逐轮单调提升,解释质量虽未被奖励也随轮次上升。

  5. 论文追踪 · 收录 · 原文 论文34

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    SafeEvolve 是一个经验驱动的智能体安全对齐自演化框架,通过已完成 on-policy 轨迹中的安全经验驱动 harness 与 policy 的持续协同演化。harness 侧将轨迹级安全证据转化为安全提示词与分层技能的有界组件级更新,policy 侧采用两阶段 SFT-RL 范式,用 harness 增强的 RL 与验证器分解奖励塑造多步探索中的自主安全行为。在 Qwen3.5-4B 上,SafeEvolve 在 AgentDojo 实现 ASR 降低 3 倍,同时将良性效用从 59.79% 提升至 61.86%。

  6. 论文追踪 · 收录 · 原文 论文52

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    研究者提出开源、框架无关的 Agent 运行时安全监督网关 ClawSentry,用于拦截被恶意第三方技能劫持的 Agent 行为。该方法把 Agent 风险分为技能准入、调用意图、执行效果和事后后果四个环节:执行前由 First-use Skill Package Review(FSPR)在确定性证据下限下审查技能包,未决案例升级到有界只读的 Agent 审查;运行时采用确定性 L1、规则锚定 L2 语义审查和只读 L3 取证 Agent 的三层渐进决策引擎,只对残余歧义投入上下文审查,并用会话级反绕过机制识别换工具与改写重试。事后路径将高严重度证据非回溯地送入后续审查。通过 Agent Harness Protocol(AHP)抽象,同一策略可应用于 Codex、Claude Code、Kimi CLI 和 Gemini CLI,无需修改 Agent 内部。

  7. 论文追踪 · 收录 · 原文 论文35

    SCOPE:训练有能力且安全的计算机使用智能体

    针对仅以任务成功为目标的训练无法让计算机使用智能体(CUA)形成可靠安全行为的问题,研究者提出 SCOPE,联合后训练任务执行能力与安全感知决策,并配套 SCOPE-Gen 自动生成可验证任务及其环境风险变体,构建含能力演示、安全续行与明确拒答的 SATraj-OS 轨迹数据集。以 Qwen3.5-9B 为起点,SCOPE-RL 在 OSWorld 上取得 54.17% 任务成功率、在 OS-BLIND 上取得 64.30% 攻击规避率,综合能力—安全得分 58.80%,为所评估智能体中最高。消融显示拒答轨迹贡献了大部分攻击规避增益,风险处理轨迹则在相近攻击规避水平下保留更高任务效用。

  8. 论文追踪 · 收录 · 原文 论文28

    生成图像更易被遗忘:面向合成图像检测的机器遗忘视角

    研究者提出把生成图像检测重构为机器遗忘问题:在大规模视觉模型(LVMs)的遗忘过程中,生成图像的特征退化速度快于自然图像,据此设计了无数据检测(剪枝模型参数诱发遗忘)和数据驱动检测(优化 LVMs 遗忘生成图像相关知识)两种方法。在多个基准上的实验显示,这种基于遗忘的方法优于传统检测方法。

  9. 论文追踪 · 收录 · 原文 论文38

    GeoDetect:面向视觉语言预训练模型的几何对抗检测方法

    研究者提出 GeoDetect,一种针对视觉语言预训练模型(VLP)的对抗样本检测方法。他们分析 VLP 嵌入空间的几何结构,发现其存在不同于单模态视觉模型的各向异性,理论分析表明对抗攻击会增大干净样本与对抗样本之间的几何间隔,对抗样本到随机采样点的期望距离更大,倾向于把表示推出流形区域。GeoDetect 利用这种偏离流形的几何分数识别对抗样本。评估显示该方法在多种 VLP 架构和威胁场景下都能可靠检测对抗样本,覆盖单模态与多模态攻击以及自适应攻击。该工作已被 ECCV 2026 接收。

  10. 论文追踪 · 收录 · 原文 论文36

    PACE:为 DeFi 中的 AI Agent 提供策略认证的合约执行框架

    研究者提出 PACE(Policy-Attested Contract Execution),一个插入在基于 LLM 的 Agent 与链上执行之间的交易级授权框架,用于应对 Agent 继承的提示注入风险以及审批无法绑定到最终上链交易的问题。PACE 引入类型化交易意图、确定性策略验证器和签名的 Policy Decision Records(PDR),将获批意图、策略与模拟报告加密绑定到确切的执行字节,并提供重放与过期保护;Solidity 智能账户在链上强制校验 PDR 签名,实测开销为 29,826-31,822 gas。作者将结论限定为可复现基准内的逻辑层安全,而非可直接部署的 DeFi 安全方案。

  11. 论文追踪 · 收录 · 原文 论文50

    WebMCP-Phalanx:为浏览器内 LLM Agent 工具调用建立信任边界

    研究者提出 WebMCP-Phalanx,一种面向 W3C WebMCP 浏览器内 LLM Agent 工具调用的双层运行时架构,用于补足同源策略在工具来源与生命周期上的不足。第一层以浏览器原生信任锚,通过加密保护的能力凭证把每个工具绑定到注册主体,并在工具生命周期内传播来源标签;第二层把语义检查与特权工具使用分离,无工具调用权限的隔离 Agent(Q-LLM)检查工具元数据、输出和页面内容中的提示注入,通过验证的内容再交给特权 Agent(P-LLM)执行,Q-LLM 内部状态对页面脚本不可见。实验显示,浏览器原生归属机制把撤销与覆写攻击成功率从 100% 降到 0%;双 Agent 运行时拦截了工具描述中嵌入的全部 80 次提示注入尝试,并把工具返回攻击限制在 80 次中的 2 次成功,任务效用与无攻击基线在统计上无差异。

  12. 论文追踪 · 收录 · 原文 论文50

    SkillGuard:面向间接提示注入的 LLM Agent 能力限制机制

    研究者提出 SkillGuard,一种 harness 层的执行约束机制,用于应对 LLM Agent 在间接提示注入下把外部技能输出带入执行上下文的问题。该方法把不可信数据进入状态视为污染事件,用 Skill Impact Graph 表示安全相关状态转移,用 steerability signatures 规定技能参数的可接受控制范围,并通过内联引用监视器介入技能调用;污染发生后按二值、分数或分数流策略计算加权能力限制,且不依赖额外的语言模型推理。分数流限制在相同攻击成功率下比二值限制保留更多能力,两种设置下均不增加模型调用或 token 开销。

  13. OWASP AI Exchange · 收录 · 原文 43

    OWASP AI Exchange 指南补充流式输出跨分块敏感信息过滤方法

    OWASP AI Exchange 项目在 AI 安全与隐私指南的敏感输出处理章节新增一条实现要点,指出当模型输出按 token 等分块流式返回时,敏感值可能被拆到两个或多个分块中,导致任何单块都不匹配。逐块过滤或在过滤前固定拼接上一块若干字符都无法阻止泄露,因为组合文本被检查时前半部分已经发出,即使过滤器记录到检测成功。指南建议在匹配仍可能延伸进缓冲区时暂不释放文本,或缓冲到句子乃至整段响应边界;若缓冲区达到上限而匹配仍可能未闭合,应停止输出而不是释放已暂存内容。文中给出的测试判据是,对同一文本的每一种分块方式,流式输出都应等于一次性过滤整段文本的结果。

  14. 论文追踪 · 收录 · 原文 论文46

    UCM:为网页智能体遮蔽不可信内容以提供安全保证

    研究者提出 Untrusted Content Masking(UCM),一种为网页智能体恢复可信与不可信内容边界的防御方法,用于抵御提示注入攻击。该方法利用网页 DOM 结构足以区分可信与不可信区域这一特性,在不可信内容到达智能体前将其遮蔽,并通过带严格权限隔离的沙箱接口完成交互,使智能体在观察和操作环境的同时与对抗性内容隔离。作者称该方法简单有效,代码已公开。论文作者包括 Kristina Nikolić、Egor Zverev、Javier Rando、Matthew Jagielski、Edoardo Debenedetti、Florian Tramèr。

  15. 论文追踪 · 收录 · 原文 论文34

    AUDITPLAN:先提交安全计划再作答的可审计安全对齐方法

    AUDITPLAN 让模型先输出包含威胁标签、预期动作和显式约束的结构化安全计划,再据此作答,计划对用户隐藏但可机器审计。该方法用监督微调加 FAITHGATE 奖励门控强化学习训练,仅在安全计划正确时才给予答案奖励。在 Qwen2.5-3B-Instruct 上,ASR 从 24.0% 降至 11.6%,LSR 从 1.0% 降至 0.36%,过度拒答从 11.0% 降至 2.0%,Qwen2.5-1.5B-Instruct、Qwen-3-4B-Instruct 和 Qwen2.5-7B-Instruct 上趋势一致。

  16. 论文追踪 · 收录 · 原文 论文41

    HerHealthEval:评测大语言模型对多语言女性健康沟通的理解

    研究者提出 HerHealthEval,一个针对女性健康沟通多语言理解能力的受控评测框架,覆盖英语、法语和现代标准阿拉伯语。每个临床案例提供六种沟通形式:规范、临床、外行、间接或含糊、情绪担忧以及刻意信息不足,前五种保留相同临床信息,最后一种故意省略细节以测试模型是否意识到需要追问。研究评测了一个多语言指令模型及 QLoRA 适配变体,考察关切分类、风险校准、追问行为、解析合规和跨形式一致性。结果显示聚合准确率和一致性会掩盖与安全相关的失败:在语言不对称风险监督下,多语言适配模型在法语和阿拉伯语上的分诊不足率达到 0.994;改用源自数据、语言不变的风险标签重新适配后,分诊不足率分别降至 0.572 和 0.558。论文认为稳健的多语言医疗评测需要显式测试语域变化、不确定性处理以及适配标签的来源与不变性。

  17. 量子位 · 收录 · 原文 23

    Jev 估值 100 亿美元:TypeSafe AI 创始人 Diogo Almeida 谈可靠性、benchmark 与 System-One

    TypeSafe AI 联合创始人兼 CEO Diogo Almeida 在 Latent Space 访谈中透露,其 System-One 模型 Jev 日处理量已突破一万亿 token,Jev 1.13.0 在第三方 JevBench v1.2.1 综合榜以 75.3 分排名第一,发布视频 6 天浏览量超 3870 万。他批评公开 benchmark 极易被操纵,主张以长期产品体验和工作流内评估判断模型,并称传统安全对齐的随机拒答对后台依赖型业务是严重 Bug。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  18. 论文追踪 · 收录 · 原文 论文33

    Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用

    针对视觉语言模型(VLM)跨模态隐式风险,研究者提出 Intent-Privilege On-Policy Self-Distillation(OPSD),用基于证据的意图作为训练期特权监督,把教师的意图条件偏好蒸馏给学生,每个提示词只需一次 rollout,推理时无需意图标注或额外安全模块。该方法仅用 1,447 条安全样本(比标准偏好数据集少 95%),训练时间较多次 rollout 的 GRPO 式训练减少 5 倍,平均推理长度降低 7%。在全部五个评测组中,OPSD 取得最高的安全-有用联合成功率,在 SIUO+HoliSafe 合并集上从 43.9% 升至 53.5%。