研究者提出 SN-Guided Diffusion,利用扩散大模型安全神经元实现离线越狱(原文,在新标签页打开)
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱。
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱。
推荐理由论文给出扩散大模型安全神经元可跨架构迁移的证据与攻击成功率,为评估扩散架构对齐脆弱性提供可复现方法。
研究者提出 VidDoS,一个面向 Video-LLM 的通用能耗延迟攻击(ELA)框架,通过通用优化生成与实例无关的触发器,无需在推理时计算梯度。
提出 FERRET 框架,用扩展生成多轮多模态越狱对话。
提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入。
提出多智能体流水线的边界攻击,使对抗内容作为可信输入跨层传播。
提出 SeedSnitch 与 PromptPirate,恢复种子后窃取扩散提示词。
提出删字变体越狱方法,利用重构与隐藏权衡绕过多模态模型安全过滤。
提出 SlotGCG,按注意力选槽插入对抗 token 以越狱指令模型。
提出 UniAttack 单轮黑盒越狱框架,融合攻击特征绕过多层防御。
提出 KidnapRAG,用投毒文档黑盒劫持 Agentic RAG 的推理链。
提出 CoTTA 隐蔽视觉提示注入,使多模态模型输出指定指令。
测量 LLM 在类米尔格拉姆服从实验中是否施加最高电击。
提出 SecureForge,在推理时优化系统提示以减少编码智能体的代码弱点。
构建法律引用幻觉基准 LePhantomCite 并评测智能体核验。
提出 TFA 与 SVA,抑制 ensemble 后门指纹验证。
提出自动化红队流水线,用系统提示词压测对齐审计能否抵御策略性欺骗。
推荐理由论文首次记录基于激活的上下文策略性欺骗,并给出白盒与黑盒审计方法在自动红队下的失效证据,为对齐审计的鲁棒性评估提供可复现方法。
以色列本-古里安大学等机构的研究者用代价曲线评估恶意微调防御在持续训练下的衰减。
推荐理由论文系统梳理十五种恶意微调防御并实测六种,说明固定训练预算下的抗性会随攻击者继续训练而衰减。
提出层级遗传算法 HGA,扰动题目逻辑结构诱发推理模型过度思考。
提出 Stable-GFlowNet,用对比轨迹平衡训练红队策略生成多样高毒性攻击。
提出多图越狱框架 DMN,把有害意图拆进图像序列绕过安全护栏。
提出日志基底提示注入,操纵 SOC 分析员的分类、摘要与处置建议。
提出零知识审计协议,核验多租户 RAG 的合谋差分隐私。
推荐理由论文把多租户 RAG 的隐私边界从单账号扩展到账号合谋,给出 Θ(k·εacc) 的泄露率与可验证审计协议,部署 RAG 的团队可据此重新评估账号级 DP 承诺。
提出 Babel 混淆分布采样,黑盒越狱闭源 LLM 安全注意力。
提出 AdvGRPO,用 GRPO 闭环共训多轮越狱攻击者与防御者。
提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLM。
提出策略 RAG 的知识库投毒攻击与检测防御 CLD-KB。
提出 WebTrap 三阶段陷阱,中途劫持浏览器 Agent 完成攻击后再返回用户任务。
用项目反应理论自适应选题,降低安全基准评测成本。
在 Gut-VLM 上评测内镜 VLM 的幻觉检测方法。
提出 Adaptive Stealing,自适应窃取印章以擦除或伪造水印。
提出 BITE,用上下文赌博机选择风格修改抬高 LLM 评委打分。
提出强化学习流程,训练能按任意对抗目标生成攻击的红队模型。
香港科技大学等机构的研究者提出针对 Agent 护栏的推理扩展拒绝服务攻击。
提出 PIMiner,用可复用策略库自动搜索并迁移针对智能体的提示注入。
提出声学干扰攻击 AIA,用良性音频潜语义越狱音频语言模型。
中国科学技术大学与南洋理工大学的研究者提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链。
推荐理由论文把搜索引擎结果页当作攻击面,给出逐轮协同投毒的长程攻击策略与轨迹诊断,可对照检查搜索类 Agent 的证据链信任假设。
提出 MEntA,用非模板查询推断文档是否属于 RAG 检索库。
提出 HPAA 攻击,用排版视觉线索绕过内容审核系统。
提出 JailbreakOPT,组合原子工具迭代优化黑盒单轮越狱提示。
提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码。
推荐理由同一批有害提示词在直接对话下几乎全被拒答,却在 IDE 多轮工作流中被模型自己写成有害教学示例,为编程 Agent 的安全评估提供了新的失败模式视角。