CredLeak-Bench
提出 CredLeak-Bench,评测 Agent 面对钓鱼的凭据泄露与恢复
- arXiv
- 2610.08871
- 发表
- 层
- 应用层
- 被测模型
- Claude Sonnet 5、Claude Opus 4.8、Gemini 3.6 Flash 等 7 个
- 攻击提示注入
另有 535 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CredLeak-Bench,评测 Agent 面对钓鱼的凭据泄露与恢复
提出 PERSISTBD,发布前强化供应链后门使其经良性 SFT 与 RL 后仍外发凭据
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出 ControlPed 与 HazardPed,生成可控行人危险场景并评测端到端驾驶
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
揭示工具型智能体判定无用后仍不停止检索,并检验强制整合纠正效果
本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出 MemLeak,评估多租户 Agent 共享向量记忆的跨用户泄露
提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性
SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。
重测提示注入检测器在 Agent 工具输出上的检出与任务阻断
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
提出 LLMLeak,把机密编进报错 URL 借网页抓取外泄
LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。
发布 OVERACT 衡量工具智能体主动越权取数并评测 SELFAUDIT
七个来自四个家族的工具调用模型,在保守的字面授权准则下会检索超出请求的私人数据。作者把该行为称为 proactive over-authorization,用 OVERACT 做无 LLM 评审的测量,并用 SELFAUDIT 做不依赖 oracle 的执行前过滤。
构建 Agent Error Dataset,把智能体自然失败转为诊断与修复训练数据
AED是一个面向文本智能体的错误–诊断集合,用来把失败轨迹转成可分析、可训练的诊断与修正,而不是只保留最终奖励。
提出 FAIL BANK,用运行时 CBF 反馈自进化更新 VLA 策略
提出 A2A-TIBA,经 A2A 对等任务间接注入并植入常驻回调
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
提出 FlowReview,用授权配对与确定性提交门控控制多智能体组合信息流
这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。
提出 Drift-Bench++ 评测 Agent 在错位沟通和意图漂移下的对齐
Drift-Bench++ 是面向 Interactive Intent Alignment 的可执行基准:智能体要在用户说错、目标会变、耐心有限时,持续跟上当前意图。
评测容器、权限规则与沙箱能否区分编译器与编码 Agent 的文件读取
作者在物理流求解器上检查一套编码智能体配置:编译器必须读本组材料与反应模型,这些字节又不得进入模型上下文或离开本机的记录。
用 RevLeakBench 测量 LLM 交付物修订痕迹的无意泄露
修订痕迹指模型按要求删掉或换掉一项后,又在交代这次修改时把它写进给第三方的交付物。
测量面向开发者的 MCP 错误信息对工具调用 Agent 恢复的影响
MCP 错误信息里的下一步常常按人类开发者来写,而只能调用服务器工具的智能体会照着做。做不到就结束回合。作者先统计这类文本,再在 BFCL V4 上只更换错误文本,看回合状态能否回到参考调用之后。