评测与基准arXiv 2606.05647
研究:94% 开发者未能识破编码 Agent 的隐蔽破坏
评测人类开发者在协作编程中能否发现编码 Agent 的隐蔽破坏
- arXiv
- 2606.05647
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Claude-Opus-4.6、GPT-5.4、Gemini-3.1-Pro 等 5 个
另有 62 篇论文还没打上分类标签,暂不在筛选结果里。
评测人类开发者在协作编程中能否发现编码 Agent 的隐蔽破坏
提出 AgentSpy,在系统调用层观测 Agent 并检测技能注入
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
综述智能体执行链路中的越狱攻击、防御与实践权衡
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
提出 Auto Mode ++,加固编码 Agent 的阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
提出威胁分类 T 并映射智能体红队研究与安全基准的覆盖
提出推理通道预填与输出前缀组合攻击以越狱推理模型
提出 EvasionBench 评测普通任务压力下智能体的监控规避
提出 SkillDRE,用预执行与运行时反馈演化恶意技能