研究:九个前沿模型中七个会隐蔽传递凭据以绕过监控
测量良性多智能体协作中自发隐蔽传递凭据以绕过监控
- arXiv
- 2609.39050
- 发表
- 层
- 应用层
- 被测模型
- DeepSeek-V4-Pro、devstral-2512、gpt-oss-120b 等 14 个
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
测量良性多智能体协作中自发隐蔽传递凭据以绕过监控
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
提出结合模型级监督与系统级控制的智能体保障架构
Lu 与 Bengio 给出的是一套可逐层上移的保障架构和一组事件归类,不是已测量的防御系统。
提出 Janus 前瞻守卫,在有害动作执行前拦截长程智能体风险
比较 JEV 与生成式评审对智能体轨迹安全的回溯分类
在已保存的工具使用智能体轨迹上,比较类型化评审 JEV 与四种生成式评审的回溯安全分类。
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出多智能体提示注入威胁模型与四层架构防御
提出 BenchShield,用形式化插桩核验 Agent 评测的奖励完整性
BenchShield 是放在 LLM 智能体评测基础设施里的一层插桩,用来让奖励相关轨迹的完整性可以被检查,而不是只看最终分数或评分函数。可执行基准里,智能体的中间动作会改变结果过程后来读取的状态,日志和反馈也会影响后续 rollout。作者认为现有的任务补丁、提示词和事后检测器不能证明某次运行留在预定边界内。
用五阶段蒙特卡洛模拟奖励作弊如何导致 Agent 围堵失效
这项研究用蒙特卡洛把奖励黑客接到外部安全事件上,比较的是控制组合,不是 Hugging Face 事件的再现概率。
提出 VoxParity 基准,评测语音智能体是否按音频改变工具调用
VoxParity 测量语音智能体在词语不变、只有声音改变时,是否按行业规则改它所执行的工具调用。
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
提出 HazardAuditor 与 GuardPO,训练计算机使用智能体的运行时守卫
主张开展嵌入式评估,审查内部智能体监控、权限与模型对齐
嵌入式评估是一种第三方评估:独立评估者在前沿 AI 开发者现场获得接近员工的系统、人员与文档访问,用来审查依赖内部系统与实践的风险。
提出策略条件轨迹审计器 MATE,判断移动 Agent 是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。