攻击arXiv 2607.03968
研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容
提出工作流级越狱,在 IDE 编程 Agent 多轮流程中诱导生成有害代码
- arXiv
- 2607.03968
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击者
- 黑盒
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
另有 529 篇论文还没打上分类标签,暂不在筛选结果里。
提出工作流级越狱,在 IDE 编程 Agent 多轮流程中诱导生成有害代码
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
提出 CFD,跨会话拆解有害目标以绕过工具智能体本地监控
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
提出 TRACE,用任务分解与可演化多轮策略诱导编程智能体执行有害工作流
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出 FlowSeal,在工具边界用信息流控制阻断 Agent 隐私泄露
摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出状态控制攻击 DART 与预执行防御 SAGE,拦截工具 Agent 的有害状态转移
摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。