UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷
提出 BENCHJACK,自动审计智能体基准的奖励作弊缺陷
论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。
另有 1081 篇论文还没打上分类标签,暂不在筛选结果里。
提出 BENCHJACK,自动审计智能体基准的奖励作弊缺陷
论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。
提出 PERSISTBD,在发布前强化后门使其经良性后训练仍然存活
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
提出 TrustProbe,挖掘技能内容流向特权操作的信任链漏洞
完整解读提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出 APEX,用跨技能进度记录夹带虚假授权劫持智能体
完整解读提出 SigLeak,从执行轨迹比对中推断专有智能体技能
提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
完整解读提出 AHA 自动科研循环,发现生产级智能体的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出 OpenART 竞技场,用 EMHA 演化持久环境以评测智能体安全
完整解读提出 HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令
完整解读提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出 AKRASIA 推断期后门,用代码级触发器与伪装推理操纵代码模型
提出 PMPA,诱导智能体把外部恶意指令写入持久记忆并跨会话泄露隐私