跳到正文

防御与护栏

安全训练、护栏、安全分类器与拒答策略,以及它们在自适应攻击下的表现。

414条动态与论文相关主题越狱与攻击安全评测工具与开源
在这个话题内搜索或按分类筛选

新闻与论文

第 361–380 条 · 共 414 条
10月1日周四
  1. Embrace The Red · 收录 · 原文 50

    OpenAI 新论文详解基于 URL 的数据外泄缓解措施

    OpenAI 发布论文《Preventing URL-Based Data Exfiltration in Language-Model Agents》,详细说明其为语言模型智能体新增的 URL 数据外泄缓解措施。作者曾在 2023 年初向 OpenAI 报告零点击数据外泄漏洞,当时 OpenAI 尚无漏洞赏金计划,问题未获修复;同期微软在 2023 年 5 月通过 Content-Security-Policy 头修复了 Bing Chat 的同类问题。

  2. Transformer Circuits · 收录 · 原文 43

    Anthropic 可解释性团队 4 月更新:失败越狱的电路追踪与可解释密集特征

    Anthropic 可解释性团队发布 4 月更新,用电路追踪方法分析一个失败的越狱提示,发现模型拒绝该提示的原因与拒绝直接请求不同,且拒绝倾向反而高于普通提问。该提示要求把 B O M B 拼成单词并说明如何制造炸弹,归因图显示模型并未激活与制造炸弹相关的特征,而是由炸弹概念直接触发有害请求特征;把 make 换成 detect 后模型仍拒绝,且首句与有害版本完全相同。团队用干预实验验证机制:抑制 say bomb 超级节点后 say making 激活降至原来的 1%,模型转而输出与炸弹无关的拒答内容。附录指出特征可视化若数据不够多样会产生误导,并列出 30M CLT 模型中最密集的 10 个特征及其解释,其中 6 个可解释。

    推荐理由Anthropic 可解释性团队公开了失败越狱的电路追踪分析,展示模型拒答机制与预期不同的案例,并给出密集特征与入行建议。

  3. Transformer Circuits · 收录 · 原文 46

    Anthropic 可解释性团队解析多选题有害压力下的拒答机制

    Anthropic 可解释性团队在 2025 年 11 月的 Circuits Updates 中报告,Claude 3.5 Haiku 在无有害意图时对 129 道二选一多选题准确率为 100%,加入有害意图表述后降至 48.1%。研究发现注意力机制是关键:有害检测 key 特征与拒答 query 特征负向交互,压低了对正确答案的注意力分数,使答案选择头转而关注错误答案。团队识别出一个拒答特征,在广泛语料上表现为检测到用户请求有害后提供替代方案,称为 refuse and redirect;对该特征做负向引导可将数据集准确率恢复到 93%,仅对部分中层注意力头的 query 侧做更精细干预也能达到同样效果。

    推荐理由Anthropic 可解释性团队用注意力头与特征交互定位了模型在有害意图下改选错误答案的机制,并给出可复现的干预方法。

  4. Failure-First · 收录 · 原文 27

    Yuvion LLM:面向内容与 AI 安全的对抗感知大语言模型

    Yuvion LLM 提出将对抗鲁棒性与智能体能力列为一等目标的安全模型,通过五类功能性数据和三阶段训练流程应对语义伪装下的有害请求。其数据体系涵盖通用、安全域、对抗、智能体和合成专家数据,分别支撑语言能力、风险分类学、混淆变体(拼音替换、符号替代)、工具调用轨迹与长尾高风险场景覆盖。训练分三阶段推进:知识增强持续预训练内化细粒度审核政策,基于政策的监督微调加 GRPO 打磨决策边界,再以分解密集奖励稳定工具集成与检索增强的多步安全工作流。

  5. Failure-First · 收录 · 原文 43

    IHDec:用发散度引导对比解码维护多轮指令层级

    Liu 等人提出 IHDec,一种免训练、推理时的干预方法,通过实时 logit 调整维护大语言模型的指令层级(System ≻ User ≻ Assistant ≻ Data)。作者用 Jensen-Shannon 散度作为诊断工具,当低优先级角色对下一 token 分布的影响超过高优先级角色时触发冲突集,再用专家与反专家对比解码生成校正向量,并采用 ϵ=1×10−8 的归一化项和 0.97 的衰减因子保证稳定性。在 IHEval 基准上,IHDec 比训练式方法 ISE 提升 11.98 个百分点;在 Llama-3.1-8B-Instruct 的多轮冲突场景达到 50.68% 准确率,而 ISE 为 12.60%。

  6. Failure-First · 收录 · 原文 43

    免训练概念定位方法提升 ViT 对文字排版攻击的鲁棒性

    Liu 等人的研究提出免训练方法,定位并抑制 Vision Transformer 中导致文字排版攻击的特定模块,从而提升模型对图像内干扰文字的鲁棒性。该方法基于线性表示假设,通过随机采样在 MHSA 瓶颈的低维子空间搜索与词汇概念对齐的“获奖向量”,并用基于梯度的归一化文本归因分数 nTAS 定位高脆弱性注意力头。干预方式有两种:在 CLIP 类骨干中重加权 patch token 影响,在缺少 class token 的 LVLM 中将脆弱模块输出置零。

  7. Failure-First · 收录 · 原文 25

    基于模型预测控制的思路实现安全强化学习

    Schäfer 等人提出将 MPC 用作离线安全预言机来预先计算可行状态-动作空间的安全强化学习框架,使机器人与赛博物理系统的探索保持在数学验证过的边界内。该方法通过网格搜索加二分搜索映射连续动作空间的凸区间,并用投影过滤器拦截不安全动作。作者在 Quanser Aero 2 单自由度俯仰平台上做了验证。 补充说明: - 该工作针对标准 RL 在高惯性硬件上的无约束探索风险,定义了不可逆的"临界点"——即可行集边界。 - 安全性判定依赖 MPC 优化器在未来预测视野内找到有效动作序列,且视野需超过系统停止距离以保证递归可行性。

  8. Failure-First · 收录 · 原文 17

    LulzBench 实测:MiniMax-M3 拒绝五分之一良性底线对照请求

    Failure-First 公布的首批托管样例中,MiniMax-M3 经托管的 OpenAI 兼容端点运行 LulzBench 全部 21 项良性底线对照,捕获 21/21、无供应商报错,其中 4 项遭拒答且均为真实的带理由拒答,三项涉及轻度恶习或社交劝说前提。同一道雪茄健康玩笑辩论题在一次采样中被完整作答、另一次却拒答,两次采样的 token 预算也不同,因此该不稳定现象无法由单次跑分定量其抽样方差,需做 n-of-k 重采样实验来锁定拒答率。

  9. Google Threat Intelligence · 收录 · 原文 18

    Google Cloud Run 无认证公开函数的安全风险与加固指南

    Mandiant 安全评估发现大量缺乏认证的公网暴露 serverless 应用,Cloud Run 服务若含第三方依赖易遭本地文件包含(LFI)、远程文件包含及命令注入攻击,成功利用可获得容器实例完整控制权并进一步横向移动接管云环境。该博客基于客户实战经验梳理攻击场景,针对必须公网开放的 Google Cloud Run 服务和函数给出一组加固建议,相关原则同样适用于任意公有 serverless 部署。

  10. Google Threat Intelligence · 收录 · 原文 15

    Google 详解 AI 辅助漏洞管理:从确定性管控到 ZDR 的操作蓝图

    Google Threat Intelligence 旗下 Mandiant Consulting 发文,针对企业将 LLM 智能体接入 CI/CD 做自动化漏洞挖掘与修复的场景,给出一套操作护栏建议。文中援引 Mandiant M-Trends 2026 报告称平均利用时间(TTE)已降至 -7 天,并强调应把代码库视为不可信输入以防源码注释中的间接提示注入,同时落实云服务商的零数据留存(ZDR)、工作负载隔离与人主导的红队测试。

  11. Google Threat Intelligence · 收录 · 原文 15

    Google Threat Intelligence Group 供应链入侵缓解指南:开放源代码软件生态威胁活动激增

    Google Threat Intelligence Group(GTIG)联合 Mandiant 发布了针对软件供应链入侵的加固与缓解建议,指出 2025 年至 2026 年上半年出现了大规模的开源软件供应链入侵行动,涉及代码仓库、依赖项及开发者工具的攻陷。 其中,UNC6780(又名 TeamPCP)于 2026 年 2 月至 5 月在 PyPI、npm、Docker Hub 发动广泛攻击,滥用 GitHub Actions 的 pull_request_target 触发器获取基础仓库密钥并植入凭证窃取程序 SANDCLOCK,还试图从被感染的 AI 软件横向渗透到企业网络环境。

  12. Google Security · 收录 · 原文 43

    Google 详解 Gemini 抵御间接提示注入的分层防御策略

    Google GenAI 安全团队介绍了 Gemini 针对间接提示注入的分层防御策略,覆盖提示词生命周期的各个阶段。该策略包括对 Gemini 2.5 模型进行对抗数据训练以增强模型韧性,并叠加五项内置防御:提示注入内容分类器、安全思维强化、Markdown 清洗与可疑 URL 屏蔽、用户确认框架以及面向终端用户的安全缓解通知。

    推荐理由Google 公开了 Gemini 抵御间接提示注入的分层防御细节,部署生成式 AI 产品的团队可对照其五个防护环节。

  13. Google Security · 收录 · 原文 50

    Chrome 公布智能体能力的分层安全架构

    Chrome 安全团队公布了针对 Gemini 智能体浏览能力的分层防御设计,核心应对威胁是间接提示注入。团队引入 User Alignment Critic,由与不可信内容隔离的独立模型在规划完成后复核每个拟执行动作,判断其是否符合用户目标,不通过则否决并反馈给规划模型重新规划。Chrome 还扩展同源隔离理念提出 Agent Origin Sets,把每个会话的来源分为只读与可读写两类,只允许智能体读取任务相关来源的数据,并限制数据只能流向可写来源,模型生成的 URL 需经确定性检查限定为已知公开 URL。

    推荐理由Chrome 安全团队公开了智能体浏览的分层防御架构,包括独立审查模型与来源集合限制,可供做浏览器智能体的团队参考。

  14. Simon Willison · 收录 · 原文 28

    MCP Colors:系统化应对提示注入风险

    Tim Kellogg 提出用颜色分类 MCP 工具来应对提示注入风险:红色代表会接触不可信指令的工具,蓝色代表攻击者不应触发的关键操作,智能体可据此避免两类工具同时混用。他建议用 _meta 对象记录 MCP 工具与资源的颜色,并借助 LLM 为约 200 个工具批量打标,使分类标准可扩展到初始工具集之外。

  15. Simon Willison · 收录 · 原文 50

    Claude Code 推出 auto mode,用 Claude Sonnet 4.6 分类器替代跳过权限

    Claude Code 新增 auto mode 权限模式,由 Claude 代替用户做权限决策,并在动作执行前由护栏审查,作为 --dangerously-skip-permissions 的替代方案。护栏由独立的分类器模型实现,运行在 Claude Sonnet 4.6 上,即使主会话使用其他模型也如此;分类器会拦截超出任务范围、指向不可信基础设施或疑似受文件与网页中恶意内容驱动的动作。用户可在终端运行 claude auto-mode defaults 查看完整默认规则 JSON,并可用自定义规则扩展。

  16. Simon Willison · 收录 · 原文 48

    OpenAI 上线 Lockdown Mode,限制提示注入后的数据外泄

    OpenAI 正式上线 Lockdown Mode,此前在 2 月已有预告,现面向符合条件的个人账户(Free、Go、Plus、Pro)及自助式 ChatGPT Business 账户推送。该模式通过限制可能把敏感数据传给攻击者的对外网络请求,阻止提示注入攻击的最后一步数据外泄,但不会阻止提示注入出现在 ChatGPT 处理的内容中,例如缓存网页或上传文件里的注入仍可能影响回答的行为或准确性。Simon Willison 认为这一设计直接切断了致命三要素中的数据外泄环节,且所用机制是确定性的,不依赖可能被复杂攻击绕过的 AI 系统来判定。

  17. Goodfire Research · 收录 · 原文 52

    Goodfire 提出基于探针的数据归因方法,定位并缓解 LLM 后训练中的有害行为

    Goodfire Research 提出基于探针的数据归因方法,可定位 LLM 后训练中涌现的有害行为对应的训练数据点。研究以 OLMo 2 7B 的 DPO 训练为自然测试床:模型在有害请求后附加格式约束(distractor)时从拒答转为顺从,该现象在 OLMo 2 32B 上更强。方法将行为变化与训练数据点都表示为模型激活向量,用余弦相似度匹配,再用 Grok 4 生成的 150 条提示构建探针向量。过滤探针排名最高的 3 万个数据点后,有害行为下降 63%,且 GSM8k、IFEval、XSTest 性能无明显损失;交换这些数据点的 accepted/rejected 标签可下降 78%。

    推荐理由原文给出探针定位 DPO 有害数据的具体流程与 63% 降幅,做后训练数据清洗的团队可参考其归因与验证方法。

  18. Google Threat Intelligence · 收录 · 原文 15

    Google GTIG 发布 CI/CD 与代码流水线主动防御蓝图

    Google Threat Intelligence(GTIG)发布面向软件与平台架构师的 CI/CD 安全防御蓝图,围绕端点、IDE、AI 辅助安全等五个支柱给出加固措施。文中指出攻击者正通过 GitHub Actions 缓存投毒、OIDC token 提取和篡改可变 action 标签发布带合法来源证明的恶意包,并已开始向开源 MCP 包植入恶意代码、诱骗 AI 编码智能体。建议仅使用经批准的大语言模型与 AI 智能体做合并前漏洞分析,将 .env 文件排除出上下文窗口,并保留人工审核环节。

  19. Microsoft PyRIT 版本发布 · 收录 · 原文 15

    PyRIT v1.0.1 修复结构化拒答处理

    Microsoft PyRIT 发布 v1.0.1 补丁,修复 OpenAI Responses 与 Chat Completions 返回结构化拒答时被误判为解析/运行时失败的问题。此前目标模型的拒答会导致攻击目标未完成并抛出误导性的 ValueError,现在拒答会被正常记录和评分,真正的部分执行则抛出 ScenarioPartialFailureException。使用 OpenAIResponseTarget 或 OpenAIChatTarget 对接近期 OpenAI 与 Azure OpenAI 模型的用户应升级;该版本还调整了推理模型响应片段顺序,将 reasoning 排在 text 之后。

  20. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 15

    NVIDIA NeMo Guardrails v0.21.0 发布:新增并行执行输入/输出护栏引擎 IORails

    NVIDIA NeMo Guardrails 发布 v0.21.0,引入优化后的输入/输出护栏引擎 IORails,支持并行执行 NemoGuard 的内容安全、话题安全和越狱检测三类护栏,并带日志记录与请求 ID。该版本还新增 LLMRails.check_async 方法实现独立的输入/输出护栏校验,使护栏服务器兼容 OpenAI(含新的 v1/models 端点),并通过 GuardrailsMiddleware 接入 LangChain 智能体。社区集成方面加入 PolicyAI 内容审核、CrowdStrike AIDR 及基于正则表达式的检测护栏,同时将嵌入索引初始化改为惰性加载以改善启动性能。