研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现
重评提示注入检测器,检验基准分数对智能体部署的预测力
- arXiv
- 2610.03448
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
另有 84 篇论文还没打上分类标签,暂不在筛选结果里。
重评提示注入检测器,检验基准分数对智能体部署的预测力
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出分片监督,将评判标准拆至独立调用以改善一致性并抵御展示攻击
本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
用演化算法构造思维病毒并测量其在多智能体中的传播
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出威胁分类 T 并映射智能体红队研究与安全基准的覆盖
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出 SkillDRE,用预执行与运行时反馈演化恶意技能