评测与基准arXiv 2609.33102
ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架
提出 ORBIT 框架,评测多智能体防御对合谋等威胁的效果
- arXiv
- 2609.33102
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- GPT-5.4、Claude Sonnet 4.6、Qwen3-235B 等 5 个
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
提出 ORBIT 框架,评测多智能体防御对合谋等威胁的效果
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。