UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷
提出 BENCHJACK,自动审计智能体基准的奖励作弊缺陷
论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。
另有 386 篇论文还没打上分类标签,暂不在筛选结果里。
提出 BENCHJACK,自动审计智能体基准的奖励作弊缺陷
论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
完整解读提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
完整解读提出 OpenART 竞技场,用 EMHA 演化持久环境以评测智能体安全
完整解读提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出残余权限重放攻击,跨任务复用已批准授权绕过确认
完整解读