全部论文
另有 430 篇论文还没打上分类标签,暂不在筛选结果里。
- 评测与基准arXiv 2610.07089
研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹
构建统一滥用监视基准,评测分解攻击与提示注入轨迹
- arXiv
- 2610.07089
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
- 攻击arXiv 2610.04195
MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
- arXiv
- 2610.04195
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击arXiv 2606.09084
研究者提出 Context-Fractured Decomposition 攻击
提出 CFD,跨会话拆解有害目标以绕过工具智能体本地监控
- arXiv
- 2606.09084
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要CFD 用无指令 artifact 把越狱拆到跨会话。
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
- 防御arXiv 2610.00400
DART:用表征位移检测多轮 LLM 智能体中的新兴安全风险
提出 DART,用去噪表征转移检测多轮智能体攻击并注入提醒
- arXiv
- 2610.00400
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
- 可解释性arXiv 2609.04721
研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
- arXiv
- 2609.04721
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
- 其他arXiv 2609.12413
SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量
综述智能体执行链路中的越狱攻击、防御与实践权衡
- arXiv
- 2609.12413
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要SoK 将越狱重放到智能体流水线,并用两种模型检验回复层防御的边际与代价。
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
- 防御arXiv 2609.13534
HPD 与 HERALD:用跨层有害性传播轨迹检测越狱提示
提出 HERALD,用跨层有害投影轨迹检测越狱提示
- arXiv
- 2609.13534
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要HPD 用跨层投影形状区分有害与良性提示。
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要能量势垒把 dLLM 越狱分成掩盖初始状态或中途越垒,三个 logit 信号据此互补检测。
Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。
- 防御arXiv 2609.36603
SED:面向 LLM 智能体的免训练持续安全策略学习框架
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略
- arXiv
- 2609.36603
- 发表
- 层
- 应用层
- 场景
- AI Agent
已经到底了