其他arXiv 2610.00902
用平均场博弈分析 AI 安全:以 2026 年 7 月 Hugging Face 事件为例
用均值场博弈分析多智能体集体攻击何时不是均衡
- arXiv
- 2610.00902
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要结构阈值给出干预杠杆。
用均值场博弈分析多智能体集体攻击何时不是均衡
摘要结构阈值给出干预杠杆。
提出 RSI-Master,约束自主后训练实验动作并结构化探索以防奖励作弊
提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 k-robust 联盟对齐,刻画误对齐评审下的安全委托授权
委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。