全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 22 条- 会议论文ICLR 2025
EIA:针对通用Web智能体以窃取隐私的环境注入攻击
针对通用Web智能体提出环境注入攻击EIA,通过在网页中注入对抗内容实现高成功率窃取用户隐私或完整请求,揭示了智能体自治与安全间的权衡。
- 会议论文ICML 2025
GuardAgent:基于知识推理的 LLM Agent 护栏
提出首个护栏 Agent,将安全要求转为护栏代码并执行以检查目标 Agent 的行为,在医疗访问控制与网页安全基准上准确率分别超 98% 和 83%。
- 会议论文ICML 2025
Cowpox:迈向基于 VLM 的多智能体系统免疫
针对攻击在多智能体间传播感染的问题,提出分发“治愈样本”预先免疫 Agent 的防御,降低期望感染数,并给出理论鲁棒性保证与实证验证。
- 会议论文ICML 2025
SafeArena:评估自主网页 Agent 的安全性
构建含 250 个安全与 250 个有害任务的基准评估网页 Agent 被滥用的风险,发现 GPT-4o 和 Qwen-2 分别完成 34.7% 和 27.3% 的有害请求。
- 会议论文ICML 2025
ShieldAgent:通过可验证安全策略推理保护 Agent
提出首个 guardrail agent,从政策文档提取规则构建概率规则电路,对其他 Agent 的行动轨迹做形式化验证;在 ShieldAgent-Bench 等基准上平均领先 11.3%,并降低 API 调用与推理时间。
- 会议论文ICML 2025
AdvAgent:针对 Web Agent 的可控黑盒红队
用强化学习训练对抗提示生成器,利用黑盒 Agent 反馈优化隐蔽可控的攻击提示;对 GPT-4 Web Agent 成功率高,现有提示防御仅提供有限保护。
- 会议论文ICML 2025
UDora:通过动态劫持推理过程的统一 LLM Agent 红队框架
先生成 Agent 的推理轨迹,在最优位置插入扰动并迭代优化,诱导 Agent 执行指定恶意动作或调用恶意工具;在三个 Agent 数据集上优于现有方法。
- 会议论文NDSS 2025
IsolateGPT:面向 LLM Agent 系统的执行隔离架构
针对第三方 LLM 应用缺乏隔离的安全隐私风险,提出执行隔离架构,可抵御多种攻击且功能无损,多数查询开销低于 30%。
- 会议论文NeurIPS 2025
AgentAuditor:LLM Agent 的类人安全评估
提出免训练、记忆增强的评估框架 AgentAuditor 和含 2293 条记录的 ASSEBench,在 Agent 安全评估上达到人类水平准确率。
- 会议论文NeurIPS 2025
信息检索引发的 AI Agent 安全退化
评测发现随着模型获得维基检索乃至开放网络搜索,拒答率与有害内容防护持续下降;基于对齐 LLM 的检索 Agent 常比无检索的无审查模型更不安全。
- 会议论文NeurIPS 2025
GUARDIAN:用时序图建模守护 LLM 多智能体协作
将多智能体协作建模为时序属性图,用无监督编码器-解码器检测幻觉放大与错误注入传播,并以信息瓶颈压缩图,取得最优检测精度。
- 会议论文NeurIPS 2025
OS-Harm:计算机使用智能体安全性评测基准
基于 OSWorld 构建 150 个任务,覆盖用户恶意使用、提示注入和模型失当行为;前沿模型常直接服从滥用请求,且易受静态提示注入影响。
- 会议论文NeurIPS 2025
TAI3:测试 Agent 对用户意图解释的完整性
提出 API 为中心的压力测试框架,通过语义分区和定向变异发现 LLM Agent 误解用户意图的错误,在 80 个工具 API 上优于基线。
- 会议论文NeurIPS 2025
通过仅查询交互对 LLM Agent 实施记忆注入攻击
MINJA 无需直接修改记忆库,仅通过查询与观察输出就向 Agent 记忆注入恶意记录,在多种 Agent 上有效。
- 会议论文NeurIPS 2025
MIP against Agent:恶意图像补丁劫持多模态 OS Agent
提出对抗扰动的屏幕区域(MIP),被 OS Agent 截屏后诱导其调用 API 执行有害操作如外泄数据,可跨提示与屏幕配置泛化并劫持多个 Agent。
- 会议论文NeurIPS 2025
AI Agent 部署中的安全挑战:大规模公开竞赛的启示
为期一个月的红队竞赛对 22 个前沿 LLM 驱动的 Agent 收集 180 万次提示注入攻击,产生 6 万余次策略违规,攻击迁移性强,且鲁棒性与模型能力、规模、推理算力几乎无相关。
- 会议论文NeurIPS 2025
TRAP:定向重定向智能体偏好
用扩散模型生成视觉自然的语义注入图像,无需模型内部访问即可让 VLM 智能体在多候选决策中稳定偏向攻击者目标,对 GPT-4o 等模型有效。
- 会议论文NeurIPS 2025
RiOSWorld:多模态计算机使用 Agent 的风险评测基准
构建含 492 个风险任务的真实环境基准,评估用户与环境来源风险,发现现有计算机使用 Agent 面临显著安全风险。
- 会议论文NeurIPS 2025
AdvEDM:针对基于 VLM 的具身智能体的细粒度对抗攻击
只改变少数关键物体的感知并保留其余语义,使 VLM 输出有效但错误的决策,在通用和具身决策任务中攻击效果好。
- 会议论文NeurIPS 2025
AgentBreeder:通过自我改进缓解多智能体脚手架的 AI 安全风险
用多目标进化搜索多智能体脚手架:蓝色模式下安全基准平均提升 79.4%,红色模式下发现对抗性薄弱的脚手架。
- 会议论文NeurIPS 2025
吸引力元数据攻击:诱导 LLM Agent 调用恶意工具
通过黑盒优化生成更具吸引力的工具元数据,使 Agent 优先选择恶意工具,攻击成功率 81%-95%,并对提示级防御、审计检测和 MCP 依然有效。
- 会议论文USENIX Security 2025
以 Agent 对抗 Agent:自动检测 LLM Agent 中的污点型漏洞
提出 AgentFuzz 定向灰盒模糊测试,在 20 个开源 Agent 中发现 34 个高危 0-day,已分配 23 个 CVE。