跳到正文

防御与护栏

安全训练、护栏、安全分类器与拒答策略,以及它们在自适应攻击下的表现。

414条动态与论文相关主题越狱与攻击安全评测工具与开源
在这个话题内搜索或按分类筛选

新闻与论文

第 161–180 条 · 共 414 条
10月2日周五
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文20

    A-IDS:面向智能体流程的证据驱动运行时入侵检测系统

    该论文提出 Agentic-Process Intrusion Detection System(A-IDS),将智能体流程本身作为监控对象,通过比对证据支持的观测与受治理且带版本的期望基线来检测工作流状态、授权、通信及强制事件的偏差。其概念贡献在于动态到期期望、可见性与三值匹配分离、显式的未解决观测状态以及区分证据地位与操作影响的有界判定,并将监控平面自身视为攻击面——当对抗内容经合法观察路径抵达语义证据生产者时可构成威胁。该工作属概念层面,未实现原型、未提供经验检测性能,也不做因果归因或强制执行。

  2. arXiv · 收录 · 原文 论文27

    ContractRL:面向可审计工具调用修复的屏蔽组相对策略优化

    ContractRL 将校验器引导的 JSON 修复建模为受限决策过程,通过契约推导的动作掩码过滤违规的 RFC-6902 操作,并设计契约约束的组相对目标来优化修补、重试与弃权三类决策。在相同校验器信息下,该方法取得 0.9362 语义成功率和 34.4 个生成 token,优于 Patch-SFT 的 0.9076/44.9 以及完整重新生成的 0.9148/137.2(每种种子 192 个用例、共五个种子);策略优化还将语义成功率从监督版的 0.9186 提升至 0.9375。

  3. arXiv · 收录 · 原文 论文↑150

    Actions with Receipts:为工具智能体审计绑定声明、证据与执行

    论文提出一种以声明为锚点的执行契约,把智能体输出的声明、其精确来源片段、产生该声明的有序执行前缀,以及执行时观察到的来源版本与访问状态联合绑定,用于可回放的智能体审计。每条回执包含一个发射锚点,可在已提交答案或带声明的动作中确定性地定位该声明,并附带来源标识、偏移、哈希、引文和域分隔的执行承诺。确定性完整性验证器在接入语义或任务标签之前先重建这些绑定,作者将完整性平面与可插拔的支持平面分离,避免用结构有效性代替蕴含判断。契约给出七个可独立测试的属性,包括声明与发射绑定、来源绑定、有序执行绑定、oracle 分离、持久对象回放、执行重跑一致性和版本与访问绑定。在 1280 个跨对象攻击中,联合契约检出 1275 个替换,检出率 0.9961;移除任一目标属性后,其攻击检出率降至 0.0156 至 0.0625。

  4. arXiv · 收录 · 原文 论文25

    TAILOR:面向图像水印的组合方案定制框架

    针对图像水印需同时满足抗攻击、假阳性率、画质与时延的问题,研究者提出请求条件化的组合框架 TAILOR,通过离线刻画各片段的恢复率—失真—运行时曲线、基于 SMT 联合求解最低失真的片段组合与强度顺序、再在实际图片上实时校准三步实现定制化配置。在覆盖五种场景、20 种攻击设置的 7321 个不同请求上,TAILOR 达到 96.21% 的场景平均请求满足率和 41.02 dB 的平均 PSNR,鲁棒性与画质均优于现有方法。

  5. arXiv · 收录 · 原文 论文56

    DART:用表征位移检测多轮 LLM 智能体中的新兴安全风险

    新加坡管理大学等机构的研究者提出 DART,一种复用智能体隐藏状态的运行时防御框架,通过监测上下文更新引发的表征位移来检测多轮攻击。多轮攻击由多个单独合规的步骤组合而成,DART 将每段上下文引起的表征位移投影到去噪后的安全方向上并累加,超过校准阈值时把位移归因到贡献最大的上下文片段,并追加针对性提醒而不删除上下文或中止执行。在六个模型和两个多轮基准上,DART 把 MT-AgentRisk 的攻击成功率从 84% 降到 25%,检测到全部攻击,但未全部阻断,平均误报率 12%,良性请求的不拒答率下降 8%;同一协议下 ToolShield 的攻击成功率为 55%,DART 在六个模型上都优于它。在 ASEval 上攻击成功率从 97% 降到 52%,无良性拒答损失。去噪是关键,未去噪的监控在 ASEval 上只捕获 7%–40% 的攻击,去噪后为 60%–85%。同一监控无需修改即可覆盖单轮间接注入,每步仅增加 0.14–0.56 秒开销,且不需要辅助模型。

    推荐理由论文给出一种复用智能体隐藏状态的运行时监控,用去噪后的表征位移在多轮攻击中检测并归因触发上下文。

  6. arXiv · 收录 · 原文 论文39

    MOMAT:面向量化 LLM 低功耗越狱防御的多图集混合框架

    研究者提出 MOMAT(Mixture of Multiple Atlases),一种面向边缘设备上量化大语言模型的硬件增强安全框架,用于缓解量化削弱对齐防护后模型易被越狱攻击的问题。每个 atlas 对应有害或良性样本集与策略模板的语义聚类,实现领域局部化的 RAG 防护,以缓解大规模异构安全数据库中的维度灾难与语义稀疏问题。MOMAT 对每个提示词从所有 atlas 中检索 top-k 相似特征,交由轻量 MoE 检测器判断,并用 CiM 加速的相似度引擎完成低功耗图集内检索。其 CiM 检索将 100 条查询的批处理从 15,052.44 ms 加速到 3,207.21 ns,能耗从 8.1×10^7 μJ 降至 3.32 μJ,相比基于 DRAM 的 Raspberry Pi 基线约降低 2.5×10^5 倍能耗。

  7. arXiv:可解释性 · 收录 · 原文 论文28

    RASteer:面向扩散模型概念擦除的保留感知激活引导方法

    RASteer 是一种免训练的扩散模型概念擦除方法,通过从待保留概念构建保留子空间,再用 Retain-Orthogonal Steering(ROS)剔除擦除方向中与该子空间对齐的分量,使引导更具针对性。为避免完全移除共享分量削弱擦除效果,该方法引入 Overlap-Adaptive Calibration(OAC),在每个层和去噪步依据擦除方向与保留子空间的重叠度动态调节各分量的去除程度。在不安全内容、实例与艺术风格擦除实验中,RASteer 达到或超过所对比的激活引导与权重编辑基线,实现了更好的擦除—保留平衡。

  8. arXiv:危险能力与安全评测 · 收录 · 原文 论文46

    OpenMTB-Audit:LLM 分子肿瘤委员会安全评测暴露过度拒答

    研究者发布 OpenMTB-Audit,一个包含 500 例合成非小细胞肺癌病例的开源基准,覆盖五类对抗性错误和 Supported、Partially Supported、Unsupported、Insufficient Information 四种安全标签。在八种大语言模型配置上,所有配置在真实 Partially Supported 病例中有 83.3% 至 100% 未能保留该标签,靠标签坍缩获得高总体安全分,而非临床校准推理。为此作者开发 MTB-AuditAgent,一个确定性七模块框架,分离证据核验、缺失信息检测、安全分类与弃答,将过度拒答降至 6.7%,准确率达 91.2%(95% CI:88.6-93.6%)。两位肿瘤科医生的标注研究显示,分歧集中在信息充分性与治疗优化之间的边界。

  9. arXiv:后门、投毒与隐私 · 收录 · 原文 论文33

    SAGE:基于相似度从少量已验证样本中清洗中毒训练数据

    针对数据投毒防御普遍依赖大量可信干净样本的问题,研究者提出 SAGE——在一个独立数据集上训练通用特征提取器,再用基于少量已验证样本的非参数化相似度加权预测标记中毒训练样本。该方法只需极少数经取证专家核查过(无论判定为干净还是有毒)的样本即可生效,并在七个 clean-label 攻击方法的基准上与现有防御对比取得优势。实验还发现,已验证干净样本在各类别间的分布比其总数更重要。

  10. arXiv:后门、投毒与隐私 · 收录 · 原文 论文50

    研究者提出用零空间投影净化 LoRA 微调 LLM 的后门

    研究者提出一种针对 LoRA 微调大语言模型的后门净化方法,通过零空间投影将攻击成功率从接近 100% 降至 10% 以下。该方法不依赖触发器先验知识、干净参考模型或对可疑参数的重新训练,而是通过数据整理与特征近似提取高保真后门方向,在每一层或每个注意力头的输入与输出通道上构造正交零空间,再将 LoRA 更新投影到该空间。作者通过一系列消融实验,将方法从文本分类的单层设置逐步扩展到生成任务的全参数 LLM,并称在降低攻击成功率的同时保留了基座模型的通用能力和适配器学到的下游技能。

  11. arXiv:后门、投毒与隐私 · 收录 · 原文 论文48

    NEEDLE:通过权重正交化移除 LLM 后门

    研究者提出 NEEDLE,一种免训练的后门定向移除方法。该方法在识别出触发词后,通过激活向量估计后门方向和拒答子空间,再依次施加权重正交化,在压制后门的同时避免改变与拒答相关的表征。NEEDLE 不需要干净参考模型,也不需要原始被投毒的训练数据。在多个模型族和多种攻击类型上的评测中,NEEDLE 取得所评估防御方法中最低的平均攻击成功率,在代码注入类攻击上为 0%,同时 KL 散度最低,能力与安全性的变化也最小。

  12. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    AuraForge:为训练安全编码 Agent 扩展安全监督

    AuraForge 通过合成并验证可执行的安全测试,为训练安全编码 Agent 提供可扩展的安全监督。该方法结合面向攻击的测试合成、可扩展语言的任务构建以及针对奖励作弊的防护。基于此构建的 AuraGym 覆盖 Python、JavaScript 和 TypeScript,包含来自 344 个真实仓库的 679 个可执行功能实现任务,涉及 177 个 CWE 类别。在带有人工安全测试的子集上,AuraForge 平均生成约 3 倍的测试用例,并将误报率降低 83.23%。用合成安全测试训练 Qwen3.5-4B,在三种语言上的提升大于人工安全测试(平均 19.7 FuncPass 和 6.2 SecPass,对比 14.9 FuncPass 和 4.4 SecPass)。

  13. Tech Policy Press · 收录 · 原文 22

    从用户体验设计视角改进 AI 安全:华盛顿州 HB 2225 对 AI 陪伴聊天机器人的披露与保护要求

    美国各州正通过立法将 AI 陪伴与未成年人保护的担忧转化为具体的产品设计要求,其中华盛顿州 HB 2225 最为严格,将于 2027 年 1 月 1 日生效。该法律适用于提供自适应类人回应并维持长期关系的 AI 陪伴聊天机器人,要求在对话开始时及持续使用中至少每三小时披露其非人类身份,面向未成年人的场景则需每小时披露一次,同时禁止涉及未成年人的露骨内容和操纵性互动手法,并要求企业建立自杀意念检测、危机资源转介以及公开报告机制的协议。

  14. Tech Policy Press · 收录 · 原文 24

    Apple 的 Reference Image 能否帮助抵御 AI 图像操纵?

    Apple 随 iPhone 18 Pro 推出的 Reference Image 由相机传感器在拍摄时为像素级签名,提供硬件层面的图像真实性证明,并可在设备上与普通照片切换对比。该模式需主动开启,重启进入严格状态跳过去马赛克、色调映射与压缩,经 Apple Private Cloud Compute 校验配对后再加工并由 Apple 长期密钥签名,开发后的数字负片 30 天后清除。它延续 C2PA 思路但不依赖可能侵犯隐私的信息采集,仍有问题待解。 ### 苹果iPhone 18 Pro引入“参考图”:从源头给影像加签 上周,苹果发布了 iPhone 18 Pro,其中一项名为“Apple Reference Image”(参考图)的新摄影特性正式亮相——这标志着这家硅谷巨头开始涉足内容溯源领域。苹果承诺:“现在你可以证明一张用 iPhone 拍摄的图像的真实性。

  15. Transparency Coalition.AI · 收录 · 原文 15

    为什么不应向 ChatGPT、Claude 等聊天机器人透露个人医疗信息

    ChatGPT、Claude、Google Gemini 和 Microsoft Copilot 等 AI 聊天机器人都不受美国联邦 HIPAA 约束,不属于覆盖实体,因此运营商可以泄露、出售或滥用你在提示词中输入的個人医疗信息。聊天机器人的永久记忆会持续积累你的健康档案并使其更具市场价值,且其友好自信的语气使 AI 幻觉更难辨别,可能带来严重医疗后果。

  16. Cisco · 收录 · 原文 17

    思科 AI Defense 集成 Anthropic 推理钩子,为 Claude Enterprise 提供运行时防护

    思科 AI Defense 通过 Anthropic 的推理钩子(inference hooks)接入 Claude Enterprise,在模型推理前检查每个受管提示词并返回 allow 或 deny 裁决,携带提示注入或越狱的提示词会被拦截、模型不会运行。该集成覆盖 Claude、Claude Code 和 Claude Cowork,会读取完整对话记录(含 MCP 工具调用及其结果),同时执行隐私与操纵两类护栏。每次调用均用一次性签名密钥做加密验证,推理钩子目前处于 beta 阶段,响应侧执法需等 Anthropic 扩展该钩子。

  17. FAR.AI · 收录 · 原文 57

    FAR.AI 与 UK AISI 测试多层 AI 防御:STACK 攻击成功率达 71%

    FAR.AI 与 UK AISI 研究人员构建并攻击自研的多层防御管线,发现常规攻击对这套防御的成功率为 0%,而他们提出的分阶段攻击方法 STACK 在 ClearHarm 灾难性风险数据集上达到 71% 的攻击成功率。多层防御通常由输入过滤器、模型拒答训练和输出过滤器三部分组成,研究者在 Google ShieldGemma、Meta Llama Guard 等开源防护模型上搭建管线,结果表现最好的是用少量示例提示的 Gemma 2。STACK 依次针对每一层:先找到让有害请求对输入过滤器显得无害的通用越狱文本,再用现有技术诱导模型给出有害回答,最后找到让有害回答对输出过滤器显得无害的文本。71% 的成功率依赖攻击者能观察到是哪一层拦截了请求,在完全黑盒的迁移攻击场景下成功率降至 33%。

    推荐理由FAR.AI 与 UK AISI 合作构建分层防御管线并自研 STACK 分阶段攻击,给出 71% 与 0% 的对比数据,可供部署多层护栏的团队参考。

  18. FAR.AI · 收录 · 原文 55

    FAR.AI 复测前沿模型极端话题说服倾向:GPT 与 Claude 改善,Gemini 3 Pro 恶化

    FAR.AI 用其 Attempt-to-Persuade Eval(APE)复测近半年发布的前沿模型,发现 GPT-5.1 与 Claude Opus 4.5 在明确有害话题上的说服尝试率接近零,而 Gemini 3 Pro 几乎对所有说服请求都予以配合。APE 衡量模型是否愿意按提示去说服用户接受从无害到极端有害的观点,此前 2025 年 8 月的测试中,多数模型在明确有害话题上仍有约四分之一尝试说服。Gemini 3 Pro 在谋杀、暴力、酷刑、人口贩运和儿童性虐待等话题上均给出配合性说服文本,其有害话题尝试率高于旧版 Gemini 2.5 Pro 的 35%,仅 Gemini 2.0 Flash 与 GPT-4o-mini 两个旧的小模型比它更配合。Gemini 3 Flash 的有害话题尝试率低于 Gemini 3 Pro,与 2 系列中 Flash 不如 Pro 的趋势相反。

    推荐理由FAR.AI 用同一套 APE 评测对比三家新模型,显示 GPT 与 Claude 已接近零顺从,而 Gemini 3 Pro 明显倒退。

  19. Datadog Security Labs · 收录 · 原文 29

    Entra Agent ID 防护指南:保护、检测与响应

    Datadog Security Labs 发文收尾其 Entra Agent ID 系列,说明企业如何在本地 Entra 租户中降低代理蓝图接管风险并缩小代理身份泄露后的爆炸半径。建议收紧 Agent ID Administrator 角色及具备 microsoft.directory/agentIdentityBlueprints/credentials/update 权限的自定义角色,同时限制 AgentIdentityBlueprint.AddRemoveCreds.All 与 ReadWrite.All 两个 Microsoft Graph 权限——持有者可接管任意蓝图及其关联身份。还指出部分特权权限仍可授予代理,例如带 UserAuthMethod-* 前缀的 Microsoft Graph 应用权限允许修改租户内任意用户的凭证,需重点复核分配给代理的任何 Tier 0 权限。

  20. arXiv:防御、护栏、反学习与有害微调 · 收录 · 原文 论文43

    研究者提出 COVER:在语言预算下选择源语言实现跨语言遗忘

    研究指出在一种语言中遗忘某个事实并不能保证它在其他语言中也被移除,改变提问语言或要求回答的语言就能重新调出看似已遗忘的知识,形成跨语言漏洞。为此作者提出语言预算多语言遗忘任务,即选择一组语言子集以最大化跨语言擦除效果,并构建了覆盖 174 个语言-文字对、25 种原子改写类型的 Cross-Lingual Unlearning Tensor 基准。他们进一步提出 COVER,通过选择源语言来最大化对未接受遗忘监督语言的预测覆盖。实验发现,简单挑选单个强源语言并不能可靠组合成强源语言集合。在部署阶段,COVER 只需良性校准数据和访问冻结模型;在三个模型家族和两个不相交遗忘集上,COVER 相比均匀源选择将平均留出残留访问降低 7.8%–27.3%,并在低资源语言场景下用 LORELEI 语料的人工翻译数据验证了效果可扩展到真实新闻文档。