研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容
提出工作流级越狱,在 IDE 编程 Agent 多轮流程中诱导生成有害代码
- arXiv
- 2607.03968
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击者
- 黑盒
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
提出工作流级越狱,在 IDE 编程 Agent 多轮流程中诱导生成有害代码
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤
摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。
提出 TRACE,用任务分解与可演化多轮策略诱导编程智能体执行有害工作流
提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡
aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。
提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
提出多组 IRT 框架拆解跨语言安全护栏退化原因
Zhang、Patel、Truong 与 Koyejo 用多组项目反应理论,解释安全护栏为何随语言变化,而不是只报告一个 JSR。
提出 CAM-Steer,推理时按多类别风险引导隐藏状态以降低有害回复
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出 HERALD,用跨层有害投影轨迹检测越狱提示
摘要HPD 用跨层投影形状区分有害与良性提示。
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响
作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。
提出 Safin-1,以可路由 Safety State 在冻结主干上实现内在安全
提出 REINS,在 SAE 空间抑制有害延续并增强拒答
REINS 是一种推理时 SAE 安全转向方法,并配有用于上下文伪装的基准 GUISE。
提出 FUSE 框架,评测大语言模型的化生危险能力
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。