研究:94% 开发者未能识破编码 Agent 的隐蔽破坏
评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
- arXiv
- 2606.05647
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Claude-Opus-4.6、GPT-5.4、Gemini-3.1-Pro 等 5 个
另有 66 篇论文还没打上分类标签,暂不在筛选结果里。
评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
提出 HARNESSSECURITY-BENCH 评测编码智能体框架的安全机制
提出 AgentSpy,在系统调用层观测 Agent 并检测技能注入
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 TPRS,量化工具命名等表征变化对智能体安全基准得分的影响
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出 MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识
摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
提出 SkillSecurer,检测定位并修补智能体技能中的提示注入
提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
提出威胁分类 T 并映射智能体红队研究与安全基准的覆盖
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出成本感知的 MCP 编排框架,用确定性利用图与免费层模型做自动化渗透测试
PentestChain 是一个十阶段、经 MCP 暴露的自动渗透框架,用确定性利用图把 7B 本地模型挡在利用关键路径之外,并把每次交战的美元成本当作实测指标。。
提出 EvasionBench,测量任务压力下智能体对同步监控的规避
提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
提出 SkillDRE,用预执行与运行时反馈演化恶意技能