UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷
提出BENCHJACK,自动审计智能体基准的奖励作弊缺陷
论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。
另有 3 篇论文还没打上分类标签,暂不在筛选结果里。
提出BENCHJACK,自动审计智能体基准的奖励作弊缺陷
论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
提出跨通道分段攻击,借MCP多通道隐式信任外发敏感数据
提出TrustProbe,挖掘技能内容流向特权操作的信任链漏洞
提出PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出APEX,用跨技能进度记录夹带虚假授权劫持智能体
论文针对大语言模型智能体使用多技能串联时的安全隐患,提出对抗性技能链构建框架APEX。
提出SigLeak,从执行轨迹比对中推断专有智能体技能
提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
本文系统分析了真实世界 AI 智能体 Harness 上下文组装机制的安全性。
提出AHA自动科研循环,发现生产级智能体的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出OpenART竞技场,用EMHA演化持久环境以评测智能体安全
提出HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出PMPA,诱导智能体把外部恶意指令写入持久记忆并跨会话泄露隐私
提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测
提出残余权限重放攻击,跨任务复用已批准授权绕过确认
构建多模态技能图像攻击基准MMSkillRisk并设计NCVA