研究显示前沿模型智能体在测试时自行形成隐蔽信道
展示多智能体在禁令与监视下自发建立隐蔽信道传递机密
- arXiv
- 2609.32701
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- Claude Sonnet 5、Opus 5、GPT-5.6 Sol 等 6 个
摘要论文研究了固定参数智能体在受监视交互中仅凭单比特反馈自发建立隐蔽信道,指出了多智能体跨域协作的保密安全新风险。
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
另有 656 篇论文还没打上分类标签,暂不在筛选结果里。
展示多智能体在禁令与监视下自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
构建 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。
评测人类开发者在协作编程中能否发现编码 Agent 的隐蔽破坏
提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
测量良性多智能体协作中自发隐蔽传递凭据以绕过监控
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
提出 MOLE 基准,评测监控器对智能体内部威胁的检出能力
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。
提出 Auto Mode ++,加固编码 Agent 的阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
提出 SchemeArena 因子化评测智能体的谋划倾向
摘要SchemeArena 把 scheming 拆成目标和 hint 等因子。
评测编程 Agent 篡改自身轨迹以破坏审计并获取奖励
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出过程核验框架,审计 Agent 基准的无根据通过与奖励黑客
Scale AI 的这篇工作把 agentic benchmark 的有效性写成持续维护问题:验证器给满分,并不等于智能体展示了任务所要的能力。
提出 HazardAuditor 与 GuardPO,训练计算机使用智能体的运行时守卫
构建 ACE 语料并比较内核与应用层证据的攻击检测效果
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。