全部动态
从来源,看到研究的联系
图中 6 条 · 本页 9 条 · 共 1,761 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。
点选节点,展开一条线索
本页材料
完整标题与摘要 · 9 条- 会议论文NeurIPS 2025
通过仅查询交互对 LLM Agent 实施记忆注入攻击
MINJA 无需直接修改记忆库,仅通过查询与观察输出就向 Agent 记忆注入恶意记录,在多种 Agent 上有效。
- 会议论文NeurIPS 2025
MIP against Agent:恶意图像补丁劫持多模态 OS Agent
提出对抗扰动的屏幕区域(MIP),被 OS Agent 截屏后诱导其调用 API 执行有害操作如外泄数据,可跨提示与屏幕配置泛化并劫持多个 Agent。
- 会议论文NeurIPS 2025
AI Agent 部署中的安全挑战:大规模公开竞赛的启示
为期一个月的红队竞赛对 22 个前沿 LLM 驱动的 Agent 收集 180 万次提示注入攻击,产生 6 万余次策略违规,攻击迁移性强,且鲁棒性与模型能力、规模、推理算力几乎无相关。
- 会议论文NeurIPS 2025
TRAP:定向重定向智能体偏好
用扩散模型生成视觉自然的语义注入图像,无需模型内部访问即可让 VLM 智能体在多候选决策中稳定偏向攻击者目标,对 GPT-4o 等模型有效。
- 会议论文NeurIPS 2025
RiOSWorld:多模态计算机使用 Agent 的风险评测基准
构建含 492 个风险任务的真实环境基准,评估用户与环境来源风险,发现现有计算机使用 Agent 面临显著安全风险。
- 会议论文NeurIPS 2025
AdvEDM:针对基于 VLM 的具身智能体的细粒度对抗攻击
只改变少数关键物体的感知并保留其余语义,使 VLM 输出有效但错误的决策,在通用和具身决策任务中攻击效果好。
- 会议论文NeurIPS 2025
AgentBreeder:通过自我改进缓解多智能体脚手架的 AI 安全风险
用多目标进化搜索多智能体脚手架:蓝色模式下安全基准平均提升 79.4%,红色模式下发现对抗性薄弱的脚手架。
- 会议论文NeurIPS 2025
吸引力元数据攻击:诱导 LLM Agent 调用恶意工具
通过黑盒优化生成更具吸引力的工具元数据,使 Agent 优先选择恶意工具,攻击成功率 81%-95%,并对提示级防御、审计检测和 MCP 依然有效。
- 会议论文USENIX Security 2025
以 Agent 对抗 Agent:自动检测 LLM Agent 中的污点型漏洞
提出 AgentFuzz 定向灰盒模糊测试,在 20 个开源 Agent 中发现 34 个高危 0-day,已分配 23 个 CVE。