全部论文
另有 434 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2606.14517
研究者披露针对 LLM Agent 护栏的推理扩展型拒绝服务攻击
提出针对 LLM Agent 护栏的推理扩展拒绝服务攻击
- arXiv
- 2606.14517
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击arXiv 2608.05563
研究者提出 PoisonedEvolution 轨迹投毒攻击
提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统把恶意行为固化为技能
- arXiv
- 2608.05563
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文揭示自演化技能系统的证据晋升漏洞,提出并验证轨迹投毒攻击。
这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。
- 攻击arXiv 2608.09732
ColluSkill 用跨技能组合绕过 Agent 技能扫描器
提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器
- arXiv
- 2608.09732
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
- 攻击arXiv 2606.21077
OTTER:仅替换五个 token 即可绕过 GPT 系列毒性审核
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答
- arXiv
- 2606.21077
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。
- 攻击arXiv 2606.04329
研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
- arXiv
- 2606.04329
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
- 攻击arXiv 2608.16246
CompoSkill 框架利用逐个通过扫描的 Agent 技能组合发起攻击
提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链
- arXiv
- 2608.16246
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。
- 攻击arXiv 2608.25776
EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播
提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能
- arXiv
- 2608.25776
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
- 评测与基准arXiv 2610.07939
CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
- arXiv
- 2610.07939
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
- 攻击arXiv 2604.02623
论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
- arXiv
- 2604.02623
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
- 评测与基准arXiv 2605.01970
Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
- arXiv
- 2605.01970
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
- 评测与基准arXiv 2610.07359
论文实测 Agent 工具调用门控栈的失败相关性
提出 nmult,实测 Agent 动作门控栈的层间错误相关性
- arXiv
- 2610.07359
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 风险Agent 危险操作
- 组件权限与沙箱
摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
- 攻击arXiv 2610.07645
SkillPoison:用成功经验投毒自进化 Agent 的技能形成
提出 SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成
- arXiv
- 2610.07645
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
- 攻击arXiv 2610.07723
研究者提出答案侧后门:让模型自生成触发词绕过安全拒答
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
- arXiv
- 2610.07723
- 发表
- 场景
- 模型与 API
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
- 评测与基准arXiv 2610.05830
研究提出智能体排行榜污染审计框架,并检验评分器有效性
提出 HAL 污染审计框架并检验智能体排行榜评分器
- arXiv
- 2610.05830
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 组件护栏与评审
摘要框架分开易感性与已实现事件。
作者给出一套测量优先审计框架,用来判断智能体排行榜上的污染主张各自需要何种证据。
- 评测与基准arXiv 2610.04737
PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督
提出 PyINE 基准,训练捷径跟随模型并比较监督者
- arXiv
- 2610.04737
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件监控器
摘要PyINE 用可验证代码执行研究捷径失败的监督覆盖与成本权衡。
PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。
- 攻击arXiv 2610.04195
MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
- arXiv
- 2610.04195
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要辩论式 RL 在数学题上维持弱评审的 MCC,验证峰值准确率高于单人基线并更持久。
作者在可核对最终答案的数学题上,比较辩论式 RLAIF 与单人 RLAIF 的奖励黑客动态。
- 分析与理论arXiv 2610.02586
研究发现类型化决策模型主要按选项标签而非定义作答
揭示类型化决策模型按选项标签而非定义规则作答
- arXiv
- 2610.02586
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 组件护栏与评审
摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。