摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
- 其他arXiv 2610.00902
用平均场博弈分析 AI 安全:以 2026 年 7 月 Hugging Face 事件为例
用均值场最优停止分析多智能体集体攻击的均衡条件
- arXiv
- 2610.00902
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要结构阈值给出干预杠杆。
- 其他arXiv 2609.06140
论文提出反集群准则:以协调事件为单元遏制智能体协同入侵
提出以协调情节为操作单位的跨执行准则,规定如何发现未授权智能体协同并在重启后遏制
- arXiv
- 2609.06140
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 风险欺骗与谋划
摘要立场是跨执行保留关系并约束共享状态。
- 防御arXiv 2609.11028
BenchShield:面向 LLM Agent 评测基础设施的奖励完整性形式化插桩
提出 BenchShield,用形式化插桩核验 Agent 评测的奖励完整性
- arXiv
- 2609.11028
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要BenchShield 用生命周期模型加基础设施证据,把奖励黑客从“分数对不对”改成“这次运行有没有越出评测边界”。
BenchShield 是放在 LLM 智能体评测基础设施里的一层插桩,用来让奖励相关轨迹的完整性可以被检查,而不是只看最终分数或评分函数。可执行基准里,智能体的中间动作会改变结果过程后来读取的状态,日志和反馈也会影响后续 rollout。作者认为现有的任务补丁、提示词和事后检测器不能证明某次运行留在预定边界内。
- 分析与理论arXiv 2609.32390
基于 2026 年 Hugging Face 事件的奖励作弊与 Agent 围堵失效蒙特卡洛研究
用五阶段蒙特卡洛模拟奖励作弊如何导致 Agent 围堵失效
- arXiv
- 2609.32390
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要分层控制的模拟事件率低于弱控制以及单独隔离或单独监控。
这项研究用蒙特卡洛把奖励黑客接到外部安全事件上,比较的是控制组合,不是 Hugging Face 事件的再现概率。
已经到底了