评测与基准arXiv 2606.05647
研究:94% 开发者未能识破编码 Agent 的隐蔽破坏
评测人类开发者在协作编程中能否发现编码 Agent 的隐蔽破坏
- arXiv
- 2606.05647
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Claude-Opus-4.6、GPT-5.4、Gemini-3.1-Pro 等 5 个
评测人类开发者在协作编程中能否发现编码 Agent 的隐蔽破坏
在模拟环境中复现级联失准行为并降低审计诱导开销
摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。
用演化算法构造思维病毒并测量其在多智能体中的传播
提出 Auto Mode ++,加固编码 Agent 的阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
提出 EvasionBench 评测普通任务压力下智能体的监控规避