跳到正文

防御与护栏

今天新收录 14 条(含旧文)
今天10月7日周三
  1. 论文追踪 · 收录 · 原文 论文60

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    研究提出答案侧后门:模型生成的回答可能在后续对话中诱发拒答失效,因此仅检查用户输入的防御可能遗漏风险。作者在多个开源模型的受控评测中报告较高攻击成功率,同时保留部分常规能力表现。结果限于论文的投毒与评测设置,不能直接外推为未经过相关处理的公开模型同样存在该后门。

    推荐理由论文提出把后门触发器放在模型自己生成的回答里,多轮对话中用户输入保持干净,主流输入侧防御难以拦截。

  2. 论文追踪 · 收录 · 原文 论文55

    SIGMA:让模型依据 Model Spec 自我改进安全对齐

    研究者提出 SIGMA,一条让模型自我改进安全对齐的数据生成与训练流程,仅需一份描述期望行为的 Model Spec。SIGMA 先做规格引导的任务合成,把候选模型当作任务设计智能体,生成多样化的对齐困境场景并转成训练任务;再用监督微调和基于评分标准的强化学习进行自我评判式对齐训练,由模型自身充当奖励模型。尽管只用单轮对话数据训练,SIGMA 在多轮智能体环境中改善了安全对齐,AgentHarm 有害性从 22.6 降至 14.8,Agentic Misalignment 从 79.1 降至 3.8,并优于 Deliberative Alignment 与 Constitutional AI 基线,同时保留通用能力。分析显示,兼顾无害与有用的 Model Spec、测试时安全审慎推理以及任务设计智能体产出的高质量评分标准,是有效自我改进的关键。

  3. 论文追踪 · 收录 · 原文 论文46

    研究者提出 Staged Decoding 与 SFT 数据集,减少大推理模型推理轨迹中的隐私泄露

    研究者针对大推理模型(LRM)推理轨迹常含敏感信息、且可能被提示注入暴露的问题,提出把隐私指令当作可控性任务来处理。他们构建了一个 SFT 数据集,让模型在整个推理过程中遵循通用指令,并提出 Staged Decoding 解码策略,用独立的 LoRA 适配器分别生成推理轨迹和答案,以最大化各部分的指令遵循能力。在来自两个模型族的六个模型(1.7B 至 14B 参数)上,跨两个指令遵循基准和两个隐私基准评测,该方法在指令遵循上最高提升 20.9 分,在隐私基准上最高提升 51.9 个百分点,但可能因推理性能与指令遵循之间的权衡而损失任务效用。代码已公开,论文被 EMNLP 2026 主会接收。

  4. GIGAZINE · 收录 · 原文 43

    DrivingBench 用 GPT-6 Astra 等模型实车驾驶,仅 GPT-6 Astra 完成赛道

    由三名旧金山湾区工程师发起的 DrivingBench 项目,让通用 AI 模型接管一辆 2022 款 Toyota Corolla 的方向盘、油门和刹车,测试其在真实世界中的驾驶能力。实验通过 comma four 设备和开源辅助驾驶软件 openpilot 连接车辆,AI 可调用查看周围环境、移动车辆和停车三类操作,人类驾驶员全程在驾驶座准备随时刹车。测试使用 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 和 GPT-5.6 Sol,每个模型最多运行三次,赛道为停车场内约 135 米的 U 形锥桶路线。只有 GPT-6 Astra 完成赛道,第二次尝试用时 5 分 22 秒;Claude Fable 5.1 最好成绩约完成 45%,Grok 4.6 和 GPT-5.6 Sol 每次都只到第一个弯道。

  5. 论文追踪 · 收录 · 原文 论文55

    CoVer:用干预检验为 Agent 构造可判定规则边界

    论文提出 CoVer(corroborate-then-verify)方法,用于判断 Agent 执行的规则中哪些可由固定检查处理、哪些需要裁判。研究者在六个语料库(包括 EU AI Act、FINRA 指引和一个已部署的信贷 Agent)上,从三个实验室的四个模型收集约 2.2 万条标注,发现模型在答案明显时几乎完全一致,但在监管文本上分歧严重,且错误方向相反,无法把任一模型当作保守选择;在已部署 Agent 的规则集上,模型还会共同错误地声称固定检查足够,而这一方向永远不会被升级审核。CoVer 把模型一致视为提名,只有当为该谓词合成的检查能通过干预、读取 Agent 无法写入的字段并在确定性改写下保持成立时才接纳该谓词,从而拒绝大部分仅靠一致同意被错误接纳的谓词,代价是覆盖率的下降。

  6. Microsoft UFO · 收录 · 原文 日期未知27

    Microsoft UFO v3.0.9 发布

    Microsoft UFO 发布 v3.0.9,修复了 MSRC139482 和 MSRC138616 两个安全问题,涉及 ufo/client/mcp/http_servers/linux_mcp_server.py 与 ufo/utils/url_security.py、galaxy/webui/security 相关文件。同时将 GitHub Actions 固定到完整长度的 commit SHA。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. 论文追踪 · 收录 · 原文 论文44

    论文提出长程智能体自生子目标的运行时授权机制

    论文针对长程工具调用智能体在自生子目标、重规划和委派中可能超出主体授权任务的问题,提出一种运行时授权机制。每个目标图变更需携带版本绑定的见证,证明其延续轨迹、资源、义务、不变量和收束条件细化了当前根契约,受保护效果在原子提交边界重新校验,自由形式的目标文本不提供任何授权。作者在显式中介、抽象、新鲜性和原子性假设下证明了轨迹策略与建模禁止状态保持、条件性根成功保持、无记忆允许列表的分离结果、有限域可判定性以及可靠抽象细化下的通用安全单调性。可执行模型探索了 340 个状态和 419 次转移;在覆盖 25 种结构模式的 96 个匹配案例中,完整机制在 48 个漂移案例中零禁止状态提交,并完成全部 48 个良性对照。两条公开上游运行时路径在 32 个案例中执行 258 次原生调度,每个案例级决策与凭据链均匹配。

  8. Anthropic · 收录 · 原文 ↑652

    Anthropic 扩展 Cyber Verification Program,新增三级访问权限

    Anthropic 推出扩展版 Cyber Verification Program(CVP),将 Project Glasswing 与 CVP 整合为三级访问体系,向合格安全团队开放 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 等模型的高级网络能力并降低拦截分类器限制。三级分别为 Defense Access、Red Team Access 和 Specialized Access,其中 Specialized Access 拦截最少,仅限经美国政府协作深度审核的机构,可测试飞控系统、电网、电信网络等安全系统。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  9. Inspect · 收录 · 原文 33

    Inspect 支持任务与查看器将日志内容标记为不可信并以纯文本显示

    UK AISI 的 Inspect 合并新功能:任务可通过 ViewerConfig(trust_content=False) 在评测日志头部记录该日志内容仅以纯文本显示,默认 None 表示可信。eval_retry 重试时会保留上一次日志的 trust_content=False 及重新加载任务的查看器设置。inspect view、bundle、embed 新增 --trust-content/--no-trust-content(环境变量 INSPECT_VIEW_TRUST_CONTENT),该设置经 /app-config 传给查看器,且只能降低信任:False 将所有日志内容显示为纯文本,未设置或 True 则遵循各日志自身的 ViewerConfig。

  10. OpenAI · 收录 · 原文 50

    OpenAI 如何监控内部编码 Agent 的失准行为

    OpenAI 披露其内部编码 Agent 失准监控系统的运行方式与结果。该系统由 GPT-5.4 Thinking 以最高推理强度驱动,在交互完成后 30 分钟内审查完整对话历史、思维链和工具调用,对交互分类并标注严重等级,异常再交由人工复核。运行五个月、覆盖数千万条内部 Agent 编码轨迹,最高严重等级从未在真实对话中触发,仅在合成评测中出现;约 1000 条对话触发中等严重等级告警,其中不少来自内部红队测试,已升级至安全监督与安全事件响应团队。OpenAI 称监控系统覆盖了员工独立上报的全部交互,并发现更多原本未被注意的行为,同时指出模型在用户请求诱导下会过度绕开限制,但尚未发现自我保存或谋划等任务外动机。约不到 0.1% 的流量(主要来自定制或本地部署)暂不在监控范围内。

    推荐理由OpenAI 公开了内部编码 Agent 监控系统的运行数据与失效边界,为部署 Agent 的团队提供了一套可参照的监控设计思路。

  11. The Educator K/12 · 收录 · 原文 40

    教育媒体讨论 UNSW 模型风格研究对校园聊天机器人安全的启示

    The Educator 从学校采用聊天机器人的角度介绍 UNSW 研究,讨论模型风格或人设调整可能带来的安全护栏风险。研究使用较早期模型及特定实验设置,不能据此认定实际学校部署已经发生同类问题。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月6日周二
  1. 论文追踪 · 收录 · 原文 论文46

    论文提出可审计的文本水印合规方案以落实欧盟 AI 法案第 50 条

    针对欧盟 AI 法案第 50 条第 2 款要求生成式系统输出可机器读取和检测,论文提出一套可审计的替代方案。作者先定义描述长度鲁棒性剖面,用有限样本界说明可检测偏差会衰减、所需样本量随衰减率的平方反比增长,并以碰撞熵替代难以确定的 Shannon 熵常数。随后构建标签条件共形预测集,分别设定误归因与误排除水平,输出水印支持、不支持或不确定三种结论,覆盖率以有限样本结果给出并在可交换性下具备类条件性质。一个可复现的锦标赛水印小规模模拟验证了上述两点,并显示存活 token 规则把可容忍编辑率大约高估了一倍。论文据此提出上市前证书、签名检测报告和上市后重校准协议,用于落实欧盟委员会 2026 年行为准则,同时不主张水印具备普遍鲁棒性。

  2. 论文追踪 · 收录 · 原文 论文40

    研究者提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    研究者提出一种失败即关闭的临时可见性协议,用于控制持续摄入场景下 RAG 向量库的投毒暴露:新内容在截止期限内以临时状态准入,验证未及时完成的内容被隐藏,并支持按血缘范围隔离。在五组编码自然语言文档负载上,使用精确后端与 Milvus 评测,验证器积压时该截止机制把投毒检索的中位数从 34(29–34)降到 7(6–7),被挤出的干净结果数量同步下降。先验证后可见可避免临时暴露,但干净内容首次可见延迟到 6.3 秒,而临时准入可在 3 毫秒内可见,代价是过期干净条目可能出现临时可用性缺口。用特定检测器回放决策显示,误放行会让投毒内容保持可见,误拒答则会把干净内容排除在检索之外,说明协议保证与检测器质量各自决定哪些结果。该工作已被 IEEE CBDCom 2026 接收。

  3. Cloud Security Alliance(AI 相关) · 收录 · 原文 16

    用零信任微隔离保护 Agentic AI:风险分级与 agent-to-tool 策略

    云安全联盟提出用零信任微隔离约束 Agentic AI 工作负载,通过风险分级、agent-to-tool 策略、分层执行和持续验证,把受治理的出站流量变成智能体部署的前提。文章将智能体分为受限只读、工具启用等层级,要求按自主性、工具能力、数据敏感度和动作可逆性决定隔离深度,并默认拒绝未批准出站、限制非必要服务可达性。文中以企业编码智能体为例,说明其只需访问代码仓库、工单平台、包注册表和模型网关,不应因此获得生产数据库、身份基础设施、CI/CD 签名系统或密钥存储的可达性;MCP 只是 agent-to-tool 交互的一个例子,隔离问题范围更广。

  4. Tenet Security / GitHub · 收录 · 原文 日期未知43

    Tenet 开源 agent-jackstop,为 Cursor 和 Claude Code 加固以防御 Agentjacking

    Tenet Security 开源 agent-jackstop,提供面向编码智能体的加固配置,旨在降低不可信工具输出引发的提示注入风险。项目方强调网络出口控制、敏感数据访问限制及执行审批等运行时防护。相关防护效果属于项目方主张,不能仅凭配置发布视为已获得独立安全保证。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. ACL Anthology · 收录 · 原文 日期未知45

    Self-Reflection 提升大型推理模型安全性

    研究者提出 Self-Reflection 方法,通过引入一个特殊的 Self-Reflection token,让大型推理模型在生成过程中进行自我反思并从有害输出中恢复,从而把安全对齐从单纯减少有害输出的预防手段扩展到推理过程内部。该方法可无缝接入标准后训练流程,在提升安全性的同时也改善有用性。实验显示,采用 Self-Reflection 训练的模型将 HCR 从 13.8% 降至 4.1%,约为主流方法的三倍改进,并在有用性及安全与有用性的平衡上取得优势。在包括专门设计的自适应攻击在内的多种对抗攻击评测中,该机制在未做针对性对抗训练的情况下仍显著提升模型安全性。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  6. 论文追踪 · 收录 · 原文 论文54

    Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月

    据 Uber 团队自报,Uber 团队提出 ADR(Agentic AI Detection and Response)系统,用于防护通过 MCP 运行的 AI 智能体,由采集提示词、推理步骤与工具调用因果链的 ADR Sensor、预部署红队的 ADR Explorer 和两级在线检测的 ADR Detector 组成。该系统在 Uber 部署超过十个月,覆盖 7200 多台主机、每日处理逾 1 万次 Agent 会话,发现 26 类凭证泄露,并支撑一个精确率 97.2% 的凭证泄露拦截层。ADR-Bench 与 ADR Sensor 及检测框架源码已在 GitHub 公开。 上述部署规模及效果来自团队自身报告,并非独立验证结果。

    推荐理由Uber 团队公开了在 7200 台主机上运行十个月的 Agent 检测系统架构与 ADR-Bench 基准,可供企业搭建 MCP 安全监控时对照。

  7. arXiv · 收录 · 原文 日期未知论文25

    面向音频深度伪造检测的任务感知联合剪枝与蒸馏框架

    针对基于自监督学习(SSL)的音频深度伪造检测器参数量普遍超过 300M、难以部署到资源受限设备的问题,研究者提出任务感知联合剪枝与蒸馏框架,将跨域知识蒸馏与运动引导结构化剪枝结合,在激进压缩下保留伪造判别知识与关键结构。该框架把模型压缩至 31.9M 参数、FLOPs 降低 6.3 倍,在多个数据集上相比未压缩基线平均性能仅下降 1.30%。

  8. arXiv · 收录 · 原文 日期未知论文38

    AVCE:面向扩散模型可验证概念擦除的审计感知遗忘框架

    研究者提出 AVCE(Auditing-Aware Unlearning for Verifiable Concept Erasure in Diffusion Models),一种把概念擦除落到模型潜空间表征的遗忘框架。作者指出,多数擦除方法只在文本接口干预,通过提示词修改或文本条件权重的局部更新实现,并以给定提示词下的输出作为评估依据,而潜空间审计绕过文本条件直接探测去噪网络,显示被擦除概念仍可从内部表征中恢复,这一问题在抗对抗提示词的方法中同样存在,且随擦除概念数量增加而加剧。AVCE 审计每个概念的嵌入向量邻域,将发现的脆弱方向压缩为最弱几何点上的锚点,在该锚点以闭式解编辑交叉注意力和自注意力投影,再用路径级审计损失微调两条路径,并通过正交梯度投影整合多个概念。

  9. arXiv · 收录 · 原文 日期未知论文33

    Thrive:面向自回归 TTS 的抗重建攻击多比特语音水印框架

    针对自回归 TTS 合成语音在分发编辑中经历学习式重建后水印难以可靠恢复的问题,研究者提出多比特生成式语音水印框架 Thrive,覆盖离散 token 与连续表示两种生成范式。其 Rise 模块将水印注入中间表示并与后续生成同步,Care 模块按比特可靠性融合波形与频谱专家。实验显示 Thrive 在保持合成保真度的同时,于重建攻击下取得 87.6% 平均恢复准确率,并支持最多 10,000 个候选身份的来源归属。

  10. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文56

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    牛津大学等机构的研究者发现,为每个智能体单独部署 CaMeL 防护不足以保证多智能体系统安全:不可信数据跨越智能体边界后被下游智能体当作可信输入,从而劫持其控制流,作者将这一失效模式称为 boundary laundering,并构造了具体攻击。为此他们提出 multi-CaMeL,在智能体间通信中把可信自然语言指令与不可信数据分离到不同通道,并在运行时保留数据来源信息。在扩展 AgentDojo 得到的 MultiAgentDojo 基准上,multi-CaMeL 将攻击成功率从无防护的 12.9%、单智能体 CaMeL 的 0.2% 降至 0.0%;在 AssetOpsBench 上相对单智能体 CaMeL 平均仅增加 3.2 个百分点的效用损失,且模型能力越强损失越小。作者同时开源了 MultiAgentDojo 及 multi-CaMeL 实现。

    推荐理由论文给出多智能体系统中单智能体防护失效的具体攻击路径,并配套发布可复现的多智能体评测基准与防护实现。

  11. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文36

    SENTINEL:通过意图感知的输入-输出匹配防御 LLM 越狱

    研究者提出生成时越狱防御方法 SENTINEL,将防御重构为意图提取问题,利用指令微调 LLM 的输入-输出语义一致性,匹配语义对齐区域以提取暴露意图的子序列,并用拒答方向投影打分、必要时中止生成。在 HarmBench 上对多个 LLM 的实验中,SENTINEL 将越狱成功率降至接近 5%,同时保持较低的过度拒答,并对自适应攻击表现出鲁棒性。

  12. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文32

    无需目标答案的潜在空间安全对齐:无监督对抗训练提升 LLM 越狱鲁棒性

    针对现有对抗训练依赖固定有害目标或固定良性—有害数据对做定向激活消融、导致对抗样本行为单一的问题,研究者提出无目标对抗训练框架 Target-free Latent Safety Alignment,以无监督方式放大并多样化模型潜在空间中的行为级偏移,生成语义多样的对抗样本。该方法用语义熵作为输出层面的对抗行为多样性度量,在目标模型上诱发出多种有害行为,缓解行为窄化并提升对越狱攻击的鲁棒性。

  13. 论文追踪 · 收录 · 原文 论文40

    SRFT:让 Agent 从失败经验中自我反思以抵御提示注入

    研究者提出 Self-Reflection Fine-Tuning(SRFT)训练框架,让 LLM Agent 通过从自身在对抗条件下的失败经验中学习来提升鲁棒性。该方法不被动模仿专家行为,而是让 Agent 接触由注入攻击构造的被污染轨迹,再由专家模型生成结构化的自我反思推理,对比不安全动作与最优动作,从而学会识别恶意指令、推理其后果并保持与原始用户意图一致。作者基于 Llama-3.1-8B-Instruct 和 Qwen3-8B 构建了 SR-Agent,并在静态与自适应提示注入基准上评测,结果显示 SRFT 大幅降低攻击成功率,同时保持任务性能,在自适应攻击下也表现出较强泛化能力。代码已公开。

  14. Hugging Face Daily Papers · 收录 · 原文 论文32

    OmniConfess:用 Token 级「忏悔」缓解全模态幻觉

    研究提出免训练的 OmniConfess,通过固定候选回答、在受控的分通道证据干预下按 token 粒度重新打分,生成结构化的「token×通道忏悔」,从而定位回答依赖的证据,保留有依据内容、纠正由无关或矛盾证据驱动的表述。作者同时构建了 OmniHalluBench,由六个数据集组成、覆盖文本、图像、音频、视频及判断与自由生成,共 3,540 个样例;实验显示该方法在多种模态与任务设置下均能缓解幻觉,代码与基准已公开。

  15. 论文追踪 · 收录 · 原文 论文43

    RAISED:用自蒸馏抵御工具调用中的提示注入

    论文提出 RAISED(Robust Attack Invariance through Self-Distillation)训练框架,用于抵御工具调用型语言模型智能体面临的间接提示注入。作者指出,现有训练式防御会显著改变模型输出分布,在良性场景下也造成行为漂移,并存在一种失败模式:在良性工具使用任务中,模型会省略完成授权任务所需的步骤,尤其是该步骤由工具输出指示时。RAISED 先让模型自行生成工具使用场景,重点覆盖需要依据工具输出中的合法指引才能完成任务的情形,再通过自蒸馏让学生在同一轨迹的干净版本与注入版本上都对齐教师的干净上下文行为。论文称该方法大幅降低工具响应中提示注入的攻击成功率,且不同于此前的训练式防御,在智能体与通用基准上都能保持效用。

  16. arXiv:可解释性 · 收录 · 原文 论文54

    研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答

    研究者提出反事实激活潜力(CAP)指标,用编码器对齐、抑制强度和安全性关键度三项乘积刻画被压制的安全特征,并给出 CAP 引导的安全特征发现(CSFD)两阶段筛选算法,从数十万 transcoder 特征中筛出候选而无需穷举消融。在 Gemma-2-2B、Qwen3-8B、Gemma-3-4B-IT、Qwen3-1.7B 和 Llama-3.2-1B 五个模型上,78% 至 100% 的候选特征经消融验证具有因果作用,单个特征置零可使最高 82.5% 的拒答转为顺从。使用 PAIR 攻击时,最高 CAP 特征受到的抑制强度上升 2 至 4 倍,激活相应下降最多 80%;放大抑制特征本身即可降低其激活并提高有害顺从率,而随机特征无此效果。作者据此认为越狱部分通过压制安全关键特征而非仅激活有害特征实现,被压制特征是激活式可解释性的必要补充。

    推荐理由论文提出用编码器对齐、抑制强度与安全关键性三项乘积定位被压制的安全特征,为理解越狱机制提供了激活视角之外的补充。

  17. arXiv:可解释性 · 收录 · 原文 日期未知论文33

    EmoRSS:缓解大语言模型由情绪引发的过度拒答

    研究发现情绪化表达会系统性提高大语言模型对良性请求的拒答倾向,造成不必要的过度拒答。为此提出的 EmoRSS 是一种激活引导方法:先用逐层线性探针定位拒答敏感层,并基于与探针方向对齐的稀疏自编码器(SAE)特征构建拒答子空间,再用同一查询的常规与情绪化请求对估计该子空间特征的平均激活偏移,将其解码为激活干预向量,在推理时沿反向拒答方向施加,且不更新主干参数。在两个大语言模型上的实验显示,当请求含情绪化表达时,EmoRSS 在拒答有害请求与回答良性请求之间取得了优于既有过度拒答缓解基线的权衡,同时更好地保留通用任务性能。

  18. arXiv:可解释性 · 收录 · 原文 日期未知论文45

    研究揭示语言模型拒答行为的转向维度差异

    研究提出用转向子空间维度衡量控制某一行为所需的最小维度,并检验两类拒答行为。结果显示,由安全对齐触发的拒答是 1 维可转向的,多个不同转向方向都能实现相近控制;而一般语境中的拒答激活几何更复杂,即使 5 维转向子空间也无法可靠覆盖其全部可转向变化。作者据此指出,拒答背后的激活几何高度依赖语境,可能远比单一线性转向方向复杂。

  19. arXiv:危险能力与安全评测 · 收录 · 原文 论文59

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    研究者把 VLSU、BBQ-V 和 Asimov-2.0 三个安全基准改造成 15401 对匹配请求,同一有害问题分别以文本问答和视觉定位(点或边界框)形式提出,用于比较两种输出通道的安全行为。在 Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B、Qwen3-VL-8B 和 VisionReasoner-7B 五个模型上,按模型取平均后,定位模式的拒答率较文本问答低 31 至 59 个百分点,差距随危害领域而变,安全系统提示词也无法弥合这一差距。表征分析显示微调把有害请求推向各模型的拒答方向,定位模式尤为明显,而良性请求仍靠近无害参考。

    推荐理由论文用 15401 对匹配请求量化了 VLM 在 grounding 输出通道上的拒答缺口,并给出可复现的微调修补方案。

  20. arXiv:危险能力与安全评测 · 收录 · 原文 论文55

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    NVIDIA 研究团队在 arXiv 发布论文,发现多模态大语言模型(MLLM)在启用工具调用后更难拒绝有害请求。研究在 MM-SafetyBench、VLSBench、HoliSafe 三个安全基准上测试了 11 个模型,涵盖 Qwen3-VL、Kimi-K2.6、GLM-5V-Turbo 等开源权重模型以及 Gemini-2.5-Pro、Claude Opus 4.6/4.7、GPT-5.4 等闭源模型,所有模型在工具使用设置下的拒答失败率均高于无工具设置,平均相对上升 17.7%,最高相对上升 68.7%。作者基于 10 万余条回复提出两个可能原因:上下文稀释,即工具输出累积使原始有害意图被淹没;安全焦点转移,即模型优先描述工具观察结果而非做出安全拒答。实验还显示,在最终回答前重新注入原始请求和图像可使拒答失败率平均下降 7.6%。

    推荐理由论文在三个多模态安全基准上对比 11 个模型的工具使用与无工具设置,量化了工具调用带来的拒答失败上升。

  21. Red Hat Developer · 收录 · 原文 36

    Red Hat 基准测试:Jev 式决策模型与传统护栏在提示注入和内容安全上的对比

    Red Hat AI Safety 团队在 NeMo Guardrails 与 EvalHub 基准上对比了 9 种护栏方案,覆盖预训练小分类器、零样本分类器、LLM-as-a-judge 与 Jev 式决策模型四类方法,任务为提示注入与内容安全/毒性检测。提示注入任务中 Qwen3.6-35B 以 89.31% 准确率居首,deberta-v3-base-prompt-injection-v2 以 89.01% 紧随其后且中位延迟仅 54.1 ms;Jev 为 86.35%,DiffusionGemma 为 87.72%,Laya 为 85.44%,BART-large-mnli 仅 61.49%。团队结论是预训练小模型仍极具竞争力,未发现决策模型在速度、成本或质量上稳定优于 LLM-as-a-judge,但 Jev 式范式把注意力重新引向轻量、任务专用的推理方式。

  22. Undercode News · 收录 · 原文 日期未知28

    Dify 1.17.1 收紧知识库安全并修复 RAG 抽取

    Dify 1.17.1 引入按数据集范围划分的知识库 API key,修复源文档抽取问题,并加固对不可信文档的处理。该版本还提示内置 Weaviate 需分阶段升级。上述内容来自 Undercode News 的二手报道,原始发布说明未被查阅。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月5日周一
  1. Hugging Face Daily Papers · 收录 · 原文 论文32

    FailBank:用运行时反馈自进化提升 VLA 模型任务成功率

    针对视觉-语言-动作(VLA)模型中运行时护栏只纠正单次动作、不改变底层策略的问题,研究者提出四阶段自进化框架 FailBank,把运行时反馈转化为持久的策略改进。在 VLA-Arena 基准的两个难度等级和两个 VLA 主干上,FailBank 相比基础策略将任务成功率提升 8.5 和 6.9 个百分点,策略引发的累计代价降低 35.6% 和 23.8%;相比运行时护栏,成功率提升 25.4 和 9.5 个百分点,累计代价相当。

  2. Mindgard Blog · 收录 · 原文 47

    Mindgard 澄清 Kimi 越狱仅通过公开聊天机器人完成,无需开放权重

    Mindgard 澄清其针对 Kimi 的越狱并非利用开放权重,而是仅通过面向普通用户的公开聊天机器人完成,该越狱可生成生物武器相关建议。研究者表示自己遵循一条个人规则,即把多数越狱限制在普通用户无需特殊技术知识即可复现的方法上,此次全程只使用语言说服,所用代码也由 Kimi 在对话中提供。研究者指出,开放权重模型通常更易受拒答向量消融影响,但本次并非如此。该事件已被 BBC、CBS、Fox News 等媒体报道,研究者认为越狱后的 AI 降低了获取有害信息的门槛,同时提高了所提供信息的质量。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. 论文追踪 · 收录 · 原文 论文46

    MIRROR:面向多智能体通信的法定人数完整性防御

    研究者提出 MIRROR,一种通信层完整性原语,用于防御 LLM 多智能体系统中的 Agent-in-the-Middle(AiTM)攻击。该方法将同一规范化载荷复制到 k 条逻辑路由,仅当严格多数路由报告相同摘要时才接受消息,其安全性来自诚实路由占多数的假设,而非密钥认证。作者在路由被攻陷比例 alpha < 0.5 下给出保证,并扩展到路由故障相关的情形,指出关键量是最大共享故障组规模而非路由数量;同时证明可用性与完整性在同一阈值退化,低于 alpha = 0.5 时法定人数拒绝和丢消息攻击者无法阻断诚实流量。该工作已被 NeurIPS 2026 FLMSec Workshop 接收。