研究者披露针对 LLM Agent 护栏的推理扩展型拒绝服务攻击
提出针对 LLM Agent 护栏的推理扩展拒绝服务攻击
- arXiv
- 2606.14517
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- TS-Guard-8B、Qwen3.5-9B、DeepSeek-V3.2 等 11 个
另有 102 篇论文还没打上分类标签,暂不在筛选结果里。
提出针对 LLM Agent 护栏的推理扩展拒绝服务攻击
提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统把恶意行为固化为技能
这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
提出对抗重构,仅改表述以拉高 AI 审稿分数
摘要揭示 AI 审稿系统易受纯表述重构操纵,建议在部署前解耦科学与写作评价。
提出 CONTRA,用树搜索修改良性配置以诱发 Agent 恶意动作
提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
提出 MFOTL 时序监控,用 MonPoly 检出工具 Agent 的危险动作链
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
提出 SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
提出拓扑条件后门,使模型在推断多智能体部署时向代码插入隐蔽漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
揭示无触发虚假训练下事实回答与下游决策的审计差距
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
检验层冻结与奇异方向截断能否挡住少样本有害微调
这篇工作检验:把拒答定位到某些层或更新方向之后,能不能在攻击者知情时还守住拒答。。
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
提出 CFD,跨会话拆解有害目标以绕过工具智能体本地监控
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
提出数据伪造攻击,使密码学模型认证在审计集通过但部署失效
这篇工作同时给出对 CMC 的数据伪造攻击,以及先承诺、后抽样的认证模板。。
用通用扰动对恶意软件分类器及漂移检测器做规避与后门投毒