跳到正文

防御与护栏

安全训练、护栏、安全分类器与拒答策略,以及它们在自适应攻击下的表现。

414条动态与论文相关主题越狱与攻击安全评测工具与开源
在这个话题内搜索或按分类筛选

新闻与论文

第 401–414 条 · 共 414 条
9月30日周三
  1. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文28

    Assay:用内容寻址证据图约束 AI 编码智能体的声明失效

    Assay 将 AI 编码智能体的每条声明(测试通过、无密钥泄露、行为不变)绑定到其覆盖代码依赖锥的 Merkle 哈希,代码或其依赖一变声明即失效。在五个公开仓库上,600 token 的简报比探索式代理省 14x 至 114x,热重建比冷重建快最多 5x;锥绑定只需重验 7.9% 至 81.9% 的声明,而按模块绑定会漏掉 23% 至 68% 的应失效声明。

  2. Google Security · 收录 · 原文 33

    Google Workspace 如何持续缓解间接提示注入攻击

    Google 通过持续发现新攻击、扩充漏洞目录并迭代防御,缓解 Workspace with Gemini 面临的间接提示注入(IPI)威胁。其手段包括人工红队测试、自动化红队测试、Google AI 漏洞奖励计划(VRP)和公开攻击情报收集,并用 Simula 生成合成数据,使合成数据生成量提升 75%。

  3. METR · 收录 · 原文 46

    METR 发布逐动作监控研究笔记:为自家评测部署实时阻断监控器

    METR 研究人员发布研究笔记,介绍其为自家 Agent 评测部署的逐动作实时监控器:由 LLM 裁判在每个工具调用执行前打分,超过阈值即暂停评测并转人工复核。

    推荐理由METR 公开了自建逐动作监控器的论证结构与实测数据,并列出五个尚未闭合的缺口,可供做 Agent 评测监控的团队对照自查。

  4. Help Net Security AI · 收录 · 原文 30

    安全工具现可扫描 Claude Enterprise 聊天与上传文件中的敏感数据

    超过 100 家安全与合规厂商已接入 Claude Compliance API,可将 Claude 活动数据送入企业现有监控工具,CrowdStrike、Microsoft Purview、Splunk、Palo Alto Networks、Cloudflare 和 Zscaler 均在列。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. SPY Lab · 收录 · 原文 50

    SPY Lab 研究:统一多模态模型无法凭记忆描述图像

    SPY Lab 提出“模态失语症”概念,指统一多模态模型能生成记忆中的图像,却无法通过文本查询访问同一知识。研究用九张电影海报测试 ChatGPT-5,图像生成的整体错误率明显低于口头描述,且重大幻觉只出现在文字描述中。

    推荐理由研究提出统一多模态模型能生成却无法描述记忆图像的现象,并展示其可绕过基于文本的安全过滤。

  6. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文48

    研究者提出 Controlled Decoding Attacks,通过纯文本接口越狱黑盒 LLM

    研究者提出一种针对黑盒大语言模型的越狱框架,仅通过允许重复采样和助手前缀续写的纯文本接口实施攻击,无需模型权重或数值 token 概率。该方法用采样输出结合未观测动作先验重建分布,再依据响应前缀决定在哪些位置重建和修改分布,并用推测式多 token 执行摊薄目标调用成本。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。

  7. DeepMind Safety Research · 收录 · 原文 50

    DeepMind 提出一致性训练,可限制谄媚与越狱

    DeepMind Safety Research 提出一致性训练,让模型对用户偏见或越狱包装等无关线索保持不变,分为输出层的 BCT 和内部激活层的 ACT。在 Gemini 2.5 Flash 上,BCT 将 ClearHarm 上的攻击成功率从 67.8% 降至 2.9%,ACT 降低越狱的效果较弱但几乎不增加对良性请求的拒答。

    推荐理由DeepMind 提出用一致性训练替代静态 SFT 数据集,并给出在 Gemini 2.5 Flash 上降低越狱成功率的对比数据。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    ACTR:对齐推理与回答以提升推理大语言模型的多语言安全

    研究者提出 ACTR 框架,通过强化推理大语言模型已有的安全推理来提升多语言安全对齐。方法先用 think gap score(TGS)比较不同语言下推理痕迹对注意力输出的归一化贡献,并用推理痕迹替换衡量跨语言安全差距;再用越狱查询语料,通过神经元掩码引起的回答表示变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理的安全 think 神经元;最后提出 neuron-selective consistency optimization(NSCO),用冻结的评判模型奖励推理痕迹与回答在安全类别上的一致,只更新选定神经元相关参数,无需人工标注回答或偏好数据。