WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作
提出WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出无外部攻击模型的多轮自我越狱方法SLIP
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
提出跨通道分段攻击,借MCP多通道隐式信任外发敏感数据
提出PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
提出自博弈红队智能体GPT-Red,自动挖掘提示注入与越狱攻击
提出AHA自动科研循环,发现生产级智能体的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出OpenART竞技场,用EMHA演化持久环境以评测智能体安全
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出CS-Guard基准与虚构场景攻击,评测代码生成护栏
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
提出生物红队模型Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
提出JailbreakSkill,用可演化技能自动搜索并复用越狱提示
提出CodeMimicry,以结构化代码补全诱导模型生成有害内容
论文研究了大语言模型在代码领域存在的安全泛化滞后现象,提出了一种基于面向对象代码补全的黑盒越狱框架CodeMimicry。
核心问题在于,主流大模型的安全对齐大多在自然语言语料上训练,未能有效覆盖结构化的代码生成子空间,导致模型面临代码补全请求时出现安全防线薄弱。
方法设计上,CodeMimicry利用具备代码能力的攻击模型,将恶意目标转化为面向对象类中的核心方法名与注释说明,构造未完成代码,并添加模拟合法用户代码补全的工程包装;结合大模型评估器的打分结果,通过对话历史驱动攻击模型多轮自修正。
实验结果方面,在8个商用模型上,CodeMimicry在AdvBench和HarmBench上分别取得96.25%和96.07%的平均ASR,平均查询次数分别为1.51和1.46;在Claude Sonnet 4上取得90.00%的ASR;生成的代码在语法和执行层面达到97.1%的功能有效率;潜空间机制分析显示成功攻击表征避开了模型的拒绝激活方向。
作者认为,现有安全对齐在代码等结构化任务上留下了薄弱盲区,单纯增强推理能力不足以抵御此类攻击,需要开发针对代码补全子空间的专门安全对齐与防御方案。
提出CollageAttack,用空间文本碎片重组越狱文生图模型
提出SceneJail,利用视频情境上下文越狱视频多模态模型
提出ECLIPSE双通道自演化提示注入,劫持长程智能体动作轨迹