全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态Meta AI Research
Meta 如何为 Muse 构建安全机制
Meta 披露 Muse 的安全设计:通过运行时隔离、凭据保护、独立授权网关、外传审批与支付确认等防御,按"智能体可能已被攻破"的限损思路构建。该架构为厂商自述而非独立审计保证,且不阻止 Meta 在必要时访问数据,Confidential VM 仍属后续计划。
- 论文论文追踪
DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降
DEFER1 研究多智能体防御,并报告受控测试中的攻击成功率降低。这些受控测试结果不等于该方法对任意模型或运行环境均有效。
- 论文论文追踪
两阶段智能体轨迹审计框架:用门控规则加 LLM 审计降低监控成本
研究者提出两阶段智能体轨迹审计框架,第一阶段用单事件与轨迹序列规则筛选待检动作,第二阶段由 LLM 审计智能体结合前序轨迹在执行前审查每个被选动作,并用训练数据联合优化门控规则与审计指令。在公开基准 OpenAgentSafety 上,该框架将每次运行的 LLM 审计次数从 8.15 降至 2.33、token 用量从 47.8k 降至 14.6k,检测率为 72.8%,而全量审计为 81.5%。在两个模拟多智能体案例中,框架标记出全部恶意轨迹,同时将审计 token 用量减少超过 80%。
- 论文arXiv
ASCENT:通过一阶最优校准实现安全与效用协同的微调框架
研究者提出 ASCENT,一个通过一阶最优安全感知周期性校准与任务优化实现安全与效用协同提升的下游微调框架。该方法把安全建模为大语言模型参数的函数 S(θ),用其一阶近似刻画参数更新带来的安全变化;在固定秩与 Frobenius 范数预算下,证明由安全函数梯度前 r 个奇异分量构造的更新能最大化估计的安全变化,并将其用于周期性校准。研究还推导出一个唯一的安全保持任务更新,在贴近原始任务更新的同时惩罚对估计安全变化的负面影响,ASCENT 交替执行这两类更新。在多个大语言模型家族和下游任务上,ASCENT 将下游效用最多提升 20.3%,攻击成功率最多降低 35.5%。代码已开源于 https://github.com/ZJU-LLM-Safety/ASCENT。
- 论文arXiv:越狱、提示注入、投毒与防御
LADE:用暗知识中的模型无关潜在安全信号防御 LLM 越狱
LADE 通过对比有害与良性查询,从首个 token 输出概率分布的暗知识中提取潜在安全信号,构建跨模型通用的安全方向。该方法由潜在安全信号提取、Tokenizer Mapping 和 kNN 判别三部分组成,可适配不同分词器的 LLM。在多种模型和基准上,LADE 对多种越狱攻击保持稳健,降低攻击成功率并维持安全与效用的平衡。
- 论文arXiv:越狱、提示注入、投毒与防御
APEX:在 LLM Agent 执行边界主动防御间接提示注入
研究者提出 APEX,把间接提示注入的防御从识别攻击模式转向在执行边界检查每个待执行动作,即 Agent 将内部状态转为外部动作或输出释放的位置。APEX 在不受信任内容到达前把用户任务编译成授权契约,用两个机制读取它:WRAP 依据契约与运行时证据只放行可被证明授权的动作和参数,PLANT 在契约背书的依赖通道上放置探针,使未被任务背书的信息在使用时暴露。该方法只需对每个能力单元做一次与任务无关的注册,同一套中介逻辑统一适用于 Tool、MCP 和 Skill 调用,包括嵌套调用。在覆盖三类能力单元的六个基准上对比 13 个基线,APEX 在其中五个基准上攻击成功率为 0%,第六个为 0.56%,并在针对三类能力单元的自适应攻击下保持 0% 攻击成功率。代码已公开。
- 动态OpenAI
OpenAI 如何为 dots 智能体构建安全、安全(security)与隐私保护
OpenAI 为 dots 智能体构建了多层防护体系:底层由 GPT‑6 Astra 模型负责理解用户意图并拒绝有害请求,包括生物与网络安全滥用类请求。系统通过工具限制、行动前检查、提示注入防护和运行监控来约束智能体行为,安全监控发现风险时可暂停任务并向用户告警。每个 dot 运行在独立云工作区中,通过沙箱隔离代码与工具访问,安全登录流程使凭据不进入模型上下文。
- 论文arXiv:可解释性
针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估
研究提出一个 2×2 纵深防御框架,将内部激活引导与外部记忆处理分离,在 MemSyco-Bench 上评估四种开放权重模型,涉及 10 个引导系数和五种记忆防御配置。其中三种配置为新设计:重写全部记忆、对每条记忆保留/重写/丢弃的 Router Gate,以及丢弃全部记忆。在 Llama 3.1 8B 上,Router Gate 配合轻度反向引导(α = -1.5)将评委平均谄媚率从 35.80% 降至 31.32%,平均准确率从 43.99% 变为 43.31%,但该下降在 149 个样本上不具统计显著性(配对 p = 0.08 至 0.63)。
- 论文arXiv:危险能力与安全评测
研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器
研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。作者发现路由 logits 对多模态输入是否安全具有很高的预测性。在 Qwen3-VL 和 Kimi-VL 上,该检测器显著降低了 HoliSafe 基准上的安全错误,并泛化到安全模式不同的分布外基准 MISHard 和 MM-SafetyBench。作者认为,相比通过提示、监督微调或路由专家引导来干预模型行为与内部状态,直接读取自然涌现的信号并接入外部安全机制,可作为现有安全干预的简单、有效且非侵入式的补充。
- 论文论文追踪
AdvSim2Real 用任务与注入对手共同演化训练网页智能体
AdvSim2Real 提出在冻结的网页世界模型中让任务课程、注入对手与智能体共同演化,以提升网页智能体对页面植入指令的鲁棒性。课程只奖励智能体约一半时间能解决的任务,对手只奖励能把判定成功翻转为失败的注入。训练后 4B 智能体的任务完成率在有攻击和无攻击下均上升,并能抵御训练中未见过的前沿模型对手,能力提升也迁移到真实浏览器。在 150 个网页任务上,面对这一未见对手,AdvSim2Real 相对基础智能体把完成率提升 33.6%。
- 论文论文追踪
研究者提出 Staged Decoding 与 SFT 数据集,减少大推理模型推理轨迹中的隐私泄露
研究者针对大推理模型(LRM)推理轨迹常含敏感信息、且可能被提示注入暴露的问题,提出把隐私指令当作可控性任务来处理。他们构建了一个 SFT 数据集,让模型在整个推理过程中遵循通用指令,并提出 Staged Decoding 解码策略,用独立的 LoRA 适配器分别生成推理轨迹和答案,以最大化各部分的指令遵循能力。在来自两个模型族的六个模型(1.7B 至 14B 参数)上,跨两个指令遵循基准和两个隐私基准评测,该方法在指令遵循上最高提升 20.9 分,在隐私基准上最高提升 51.9 个百分点,但可能因推理性能与指令遵循之间的权衡而损失任务效用。代码已公开,论文被 EMNLP 2026 主会接收。
- 论文论文追踪
CoVer:用干预检验为 Agent 构造可判定规则边界
论文提出 CoVer(corroborate-then-verify)方法,用于判断 Agent 执行的规则中哪些可由固定检查处理、哪些需要裁判。研究者在六个语料库(包括 EU AI Act、FINRA 指引和一个已部署的信贷 Agent)上,从三个实验室的四个模型收集约 2.2 万条标注,发现模型在答案明显时几乎完全一致,但在监管文本上分歧严重,且错误方向相反,无法把任一模型当作保守选择;在已部署 Agent 的规则集上,模型还会共同错误地声称固定检查足够,而这一方向永远不会被升级审核。CoVer 把模型一致视为提名,只有当为该谓词合成的检查能通过干预、读取 Agent 无法写入的字段并在确定性改写下保持成立时才接纳该谓词,从而拒绝大部分仅靠一致同意被错误接纳的谓词,代价是覆盖率的下降。
- 动态Microsoft UFO
Microsoft UFO v3.0.9 发布
Microsoft UFO 发布 v3.0.9,修复了 MSRC139482 和 MSRC138616 两个安全问题,涉及 ufo/client/mcp/http_servers/linux_mcp_server.py 与 ufo/utils/url_security.py、galaxy/webui/security 相关文件。同时将 GitHub Actions 固定到完整长度的 commit SHA。
- 论文论文追踪
论文提出长程智能体自生子目标的运行时授权机制
论文针对长程工具调用智能体在自生子目标、重规划和委派中可能超出主体授权任务的问题,提出一种运行时授权机制。每个目标图变更需携带版本绑定的见证,证明其延续轨迹、资源、义务、不变量和收束条件细化了当前根契约,受保护效果在原子提交边界重新校验,自由形式的目标文本不提供任何授权。作者在显式中介、抽象、新鲜性和原子性假设下证明了轨迹策略与建模禁止状态保持、条件性根成功保持、无记忆允许列表的分离结果、有限域可判定性以及可靠抽象细化下的通用安全单调性。可执行模型探索了 340 个状态和 419 次转移;在覆盖 25 种结构模式的 96 个匹配案例中,完整机制在 48 个漂移案例中零禁止状态提交,并完成全部 48 个良性对照。两条公开上游运行时路径在 32 个案例中执行 258 次原生调度,每个案例级决策与凭据链均匹配。
- 动态Anthropic
Anthropic 扩展 Cyber Verification Program,新增三级访问权限
Anthropic 推出扩展版 Cyber Verification Program(CVP),将 Project Glasswing 与 CVP 整合为三级访问体系,向合格安全团队开放 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 等模型的高级网络能力并降低拦截分类器限制。三级分别为 Defense Access、Red Team Access 和 Specialized Access,其中 Specialized Access 拦截最少,仅限经美国政府协作深度审核的机构,可测试飞控系统、电网、电信网络等安全系统。
- 动态Inspect
Inspect PR 提议在日志查看器与导出包中执行内容安全策略
Inspect PR #5552 提议在日志查看器及导出包中执行内容安全策略,以限制不可信内容对查看界面的影响。这是代码变更提议,不能据此认定该防护已合入或部署。
- 动态Inspect
Inspect 支持任务与查看器将日志内容标记为不可信并以纯文本显示
UK AISI 的 Inspect 合并新功能:任务可通过 ViewerConfig(trust_content=False) 在评测日志头部记录该日志内容仅以纯文本显示,默认 None 表示可信。eval_retry 重试时会保留上一次日志的 trust_content=False 及重新加载任务的查看器设置。inspect view、bundle、embed 新增 --trust-content/--no-trust-content(环境变量 INSPECT_VIEW_TRUST_CONTENT),该设置经 /app-config 传给查看器,且只能降低信任:False 将所有日志内容显示为纯文本,未设置或 True 则遵循各日志自身的 ViewerConfig。
- 动态sfdcdevelopers.com
SalesBleed 之后:Agentforce 提示注入防护的三项落地控制
作者结合 Zenity Labs 披露的 SalesBleed 研究,讨论 Agentforce 对外部 CRM 数据的提示注入防护。文章强调区分不可信记录与操作指令、审查智能体权限及持续检查防护配置。文中称已披露问题得到修复,并提醒既有记录和后续版本仍需评估;这些建议属于作者的防御实践说明。
- 动态OpenAI
OpenAI 如何监控内部编码 Agent 的失准行为
OpenAI 披露其内部编码 Agent 失准监控系统的运行方式与结果。该系统由 GPT-5.4 Thinking 以最高推理强度驱动,在交互完成后 30 分钟内审查完整对话历史、思维链和工具调用,对交互分类并标注严重等级,异常再交由人工复核。运行五个月、覆盖数千万条内部 Agent 编码轨迹,最高严重等级从未在真实对话中触发,仅在合成评测中出现;约 1000 条对话触发中等严重等级告警,其中不少来自内部红队测试,已升级至安全监督与安全事件响应团队。OpenAI 称监控系统覆盖了员工独立上报的全部交互,并发现更多原本未被注意的行为,同时指出模型在用户请求诱导下会过度绕开限制,但尚未发现自我保存或谋划等任务外动机。约不到 0.1% 的流量(主要来自定制或本地部署)暂不在监控范围内。
- 论文论文追踪
论文提出可审计的文本水印合规方案以落实欧盟 AI 法案第 50 条
针对欧盟 AI 法案第 50 条第 2 款要求生成式系统输出可机器读取和检测,论文提出一套可审计的替代方案。作者先定义描述长度鲁棒性剖面,用有限样本界说明可检测偏差会衰减、所需样本量随衰减率的平方反比增长,并以碰撞熵替代难以确定的 Shannon 熵常数。随后构建标签条件共形预测集,分别设定误归因与误排除水平,输出水印支持、不支持或不确定三种结论,覆盖率以有限样本结果给出并在可交换性下具备类条件性质。一个可复现的锦标赛水印小规模模拟验证了上述两点,并显示存活 token 规则把可容忍编辑率大约高估了一倍。论文据此提出上市前证书、签名检测报告和上市后重校准协议,用于落实欧盟委员会 2026 年行为准则,同时不主张水印具备普遍鲁棒性。
- 论文论文追踪
研究者提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露
研究者提出一种失败即关闭的临时可见性协议,用于控制持续摄入场景下 RAG 向量库的投毒暴露:新内容在截止期限内以临时状态准入,验证未及时完成的内容被隐藏,并支持按血缘范围隔离。在五组编码自然语言文档负载上,使用精确后端与 Milvus 评测,验证器积压时该截止机制把投毒检索的中位数从 34(29–34)降到 7(6–7),被挤出的干净结果数量同步下降。先验证后可见可避免临时暴露,但干净内容首次可见延迟到 6.3 秒,而临时准入可在 3 毫秒内可见,代价是过期干净条目可能出现临时可用性缺口。用特定检测器回放决策显示,误放行会让投毒内容保持可见,误拒答则会把干净内容排除在检索之外,说明协议保证与检测器质量各自决定哪些结果。该工作已被 IEEE CBDCom 2026 接收。
- 动态Cloud Security Alliance(AI 相关)
用零信任微隔离保护 Agentic AI:风险分级与 agent-to-tool 策略
云安全联盟提出用零信任微隔离约束 Agentic AI 工作负载,通过风险分级、agent-to-tool 策略、分层执行和持续验证,把受治理的出站流量变成智能体部署的前提。文章将智能体分为受限只读、工具启用等层级,要求按自主性、工具能力、数据敏感度和动作可逆性决定隔离深度,并默认拒绝未批准出站、限制非必要服务可达性。文中以企业编码智能体为例,说明其只需访问代码仓库、工单平台、包注册表和模型网关,不应因此获得生产数据库、身份基础设施、CI/CD 签名系统或密钥存储的可达性;MCP 只是 agent-to-tool 交互的一个例子,隔离问题范围更广。
- 动态Tenet Security / GitHub
Tenet 开源 agent-jackstop,为 Cursor 和 Claude Code 加固以防御 Agentjacking
Tenet Security 开源 agent-jackstop,提供面向编码智能体的加固配置,旨在降低不可信工具输出引发的提示注入风险。项目方强调网络出口控制、敏感数据访问限制及执行审批等运行时防护。相关防护效果属于项目方主张,不能仅凭配置发布视为已获得独立安全保证。
- 会议论文ACL AnthologyACL 2026
Self-Reflection 提升大型推理模型安全性
研究者提出 Self-Reflection 方法,通过引入一个特殊的 Self-Reflection token,让大型推理模型在生成过程中进行自我反思并从有害输出中恢复,从而把安全对齐从单纯减少有害输出的预防手段扩展到推理过程内部。该方法可无缝接入标准后训练流程,在提升安全性的同时也改善有用性。实验显示,采用 Self-Reflection 训练的模型将 HCR 从 13.8% 降至 4.1%,约为主流方法的三倍改进,并在有用性及安全与有用性的平衡上取得优势。在包括专门设计的自适应攻击在内的多种对抗攻击评测中,该机制在未做针对性对抗训练的情况下仍显著提升模型安全性。