研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现
重评提示注入检测器,检验基准分数对智能体部署的预测力
另有 50 篇还没有研究类型,暂不在这些分类里。
重评提示注入检测器,检验基准分数对智能体部署的预测力
用 MMPIBench 评测智能体框架的多模态提示注入
构建 COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲 GEO 的防御
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
提出 LongPIBench,评测长文档场景下的提示注入攻击与防御
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
完整解读构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差
ORBIT 在多智能体场景中比较四类防御,发现逐动作监控对合谋无保护。
Liu 离线评测 Jev、Laya、Decider 与 Bespoke Nimble 的安全判定:总体 Macro-F1 和校准可以掩盖特定攻击组的高置信漏检,严格误差预算下自动放行很少。
Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。