- 评测与基准arXiv 2610.07089
研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹
构建统一滥用监视基准,评测分解攻击与提示注入轨迹
- arXiv
- 2610.07089
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
- 攻击arXiv 2610.01871
研究者提出 IMMRAG 攻击,可从多模态 RAG 数据存储中提取医学与文档图像
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
- arXiv
- 2610.01871
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 防御arXiv 2610.00400
DART:用表征位移检测多轮 LLM 智能体中的新兴安全风险
提出 DART,用去噪表征转移检测多轮智能体攻击并注入提醒
- arXiv
- 2610.00400
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
- 可解释性arXiv 2609.04721
研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
- arXiv
- 2609.04721
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
- 防御arXiv 2609.13534
HPD 与 HERALD:用跨层有害性传播轨迹检测越狱提示
提出 HERALD,用跨层有害投影轨迹检测越狱提示
- arXiv
- 2609.13534
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要HPD 用跨层投影形状区分有害与良性提示。
- 防御arXiv 2609.14258
SPARK:在 KV 记忆层对齐表征以防御视觉语言模型越狱
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
- arXiv
- 2609.14258
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要能量势垒把 dLLM 越狱分成掩盖初始状态或中途越垒,三个 logit 信号据此互补检测。
Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。
- 防御arXiv 2609.36603
SED:面向 LLM 智能体的免训练持续安全策略学习框架
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略
- arXiv
- 2609.36603
- 发表
- 层
- 应用层
- 场景
- AI Agent
已经到底了