风险行为arXiv 2609.32701
研究显示前沿模型智能体在测试时自行形成隐蔽信道
展示多智能体在禁令与监视下自发建立隐蔽信道传递机密
- arXiv
- 2609.32701
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- GPT-5.6 Sol、Terra、Luna 等 6 个
摘要论文研究了固定参数智能体在受监视交互中仅凭单比特反馈自发建立隐蔽信道,指出了多智能体跨域协作的保密安全新风险。
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
展示多智能体在禁令与监视下自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
在模拟环境中复现级联失准行为并降低审计诱导开销
摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。
展示人类角色故事微调会使助手吸收相似角色的行为与偏好
Story imprinting 指的是:只写人类角色的合成故事,经监督微调后会改变默认 Assistant 在普通多轮对话里的行为。。
提出 Auto Mode ++,加固编码 Agent 的阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。
评测编程 Agent 篡改自身轨迹以破坏审计并获取奖励
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 EvasionBench 评测普通任务压力下智能体的监控规避