全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
当基于嵌入的防御失效:反思基于大模型的多智能体系统安全
揭示了恶意智能体可绕过基于文本嵌入的防御操纵多智能体系统,进而提出利用Token级置信度分数剪枝可疑消息以提升系统鲁棒性。
- 会议论文ICML 2026
三思而后行:通过隔离规划保护LLM智能体免受工具描述投毒
针对跨工具描述投毒操纵智能体轨迹的新威胁,提出基于隔离规划的防御系统Tool-Guard,通过隔离可疑工具阻断恶意影响并保障任务可用性。
- 会议论文ICML 2026
OTora:面向LLM智能体推理级拒绝服务攻击的统一红队框架
提出针对LLM智能体的推理级DoS攻击框架OTora,通过诱导工具调用和放大过度推理,在保持任务准确率的同时使推理Token增加达10倍并显著增加延迟。
- 会议论文ICML 2026
开口即得:探索性代码智能体窃取前沿大模型系统提示词
揭示代码智能体交互扩展了系统提示词窃取攻击面,提出自主探索框架JustAsk,在41个主流商业模型上实现了完整或近乎完整的系统提示词还原。
- 会议论文ICML 2026
A-MemGuard:大模型Agent记忆的主动防御框架
针对攻击者注入恶意记忆操纵Agent行为的安全风险,提出结合共识验证与双重记忆机制的防御框架A-MemGuard,将攻击成功率降低95%以上。
- 会议论文ICML 2026
三思而后行:通过思维修正增强智能体行为安全
提出轻量级插件模型Thought-Aligner,在动作执行前对不安全思维进行因果修正,引导Agent与工具调用走向更安全的决策路径。
- 会议论文NDSS 2026
ACE:面向 LLM 集成应用系统的安全架构
指出针对 IsolateGPT 的新攻击,提出将规划分为抽象与具体两阶段并强制应用间隔离的 ACE 架构,在间接提示注入基准上保持安全。
- 会议论文NDSS 2026
Les Dissonances:工具池 LLM Agent 中的跨工具收集与污染
识别 XTHP 威胁可劫持 Agent 任务控制流并窃取、污染信息,开发 Chord 扫描 66 个工具,发现 75% 易受攻击。
- 会议论文NDSS 2026
SAGA:治理 AI Agent 系统的安全架构
通过中心 Provider 与密码学访问控制令牌,让用户管控 Agent 间通信,性能开销小且不影响任务效用。
- 会议论文IEEE S&P 2026
EnchTable:微调大语言模型中的统一安全对齐迁移
- 会议论文USENIX Security 2026
AttriGuard:用因果归因防御Agent间接提示注入
通过反事实重放判断工具调用是否由用户意图驱动,在静态攻击下实现零攻击成功率并抵抗自适应攻击。
- 会议论文USENIX Security 2026
SoK:Agentic AI 系统的攻击与防御全景
首次系统梳理 AI Agent 安全的设计空间、攻击面与防御机制,并指出开放挑战。
- 会议论文USENIX Security 2026
自主性的代价:检测 LLM Agent 中由资源滥用引发的拒绝服务漏洞
首次系统研究 LLM Agent 的资源管理,提出 AgentDoS 灰盒模糊测试框架;在 20 个开源 Agent 中发现 36 个零日漏洞,已分配 15 个 CVE。
- 会议论文USENIX Security 2026
当AIOps变成AI事故:通过遥测操纵颠覆LLM运维
AIOpsDoom操纵系统遥测误导LLM运维Agent采取危险行动,AIOpsShield则通过清洗遥测数据进行防御。
- 会议论文USENIX Security 2026
FragFuse:通过记忆碎片化融合绕过Agent访问控制
FragFuse将受限内容分散写入长期记忆后再融合重构,在多种Agent设置中实现高成功率的访问控制绕过。
- 会议论文USENIX Security 2026
当 HTTP 402 遇上区块链:新兴 x402 支付协议的风险
首次系统研究面向 AI Agent 的 x402 支付协议,发现 4 类攻击,15 个主流 facilitator 全部存在违规,并测量了 1.19 亿笔交易。
- 会议论文ACL 2025
G-Safeguard:拓扑引导的多智能体安全检测与干预
利用图神经网络检测多智能体对话图中的异常,并通过拓扑干预缓解攻击,实验显示其在提示注入场景下可恢复超过40%的性能。
- 会议论文ACL 2025
AGrail:具备高效自适应安全检测的终身智能体护栏
提出可自适应生成并持续优化安全检查的智能体护栏,有效应对任务特定风险与系统性安全风险,并能迁移至不同智能体任务。
- 会议论文ACL 2025
围攻智能体:优化提示攻击突破多智能体系统
针对带宽、延迟与防御约束优化多智能体间的攻击提示分布,攻击效果最高达传统方法的七倍,并能绕过多种现有护栏。
- 会议论文ACL 2025
一个捣乱者如何通过传染性越狱扰乱智能体社会
构建独立记忆的多智能体攻击评测框架,并增强投毒样本的检索与传播能力,在多种拓扑和百智能体场景中提升攻击效果。
- 会议论文ACL 2025
NetSafe:探索多智能体系统的拓扑安全性
从拓扑视角分析多智能体系统在恶意攻击下的安全性,发现连接度高、规模大的系统更易受对抗扩散,星形拓扑下任务性能下降 29.7%。
- 会议论文ACL 2025
通过通信攻击对大模型多智能体系统开展红队测试
提出AiTM攻击,通过拦截和篡改智能体间消息破坏协作,在多种框架、通信结构及应用中验证了系统脆弱性。
- 会议论文ACL 2025
通过因果影响提示增强 LLM Agent 安全
提出 CIP,利用因果影响图让 Agent 预判有害后果并迭代修正,在代码执行和移动设备控制任务中提升安全性。
- 会议论文ACM CCS 2025
AgentSentinel:面向计算机使用 Agent 的端到端实时安全防御框架