评测与基准arXiv 2610.03448
研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现
重评 Agent 提示注入检测器,检验基准分数能否预测部署表现
- arXiv
- 2610.03448
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
重评 Agent 提示注入检测器,检验基准分数能否预测部署表现
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
分析良性知识蒸馏中提示模板对学生拒答保留的影响
阐述旗舰基础模型的预训练与后训练方法并公开权重与安全模型
提出 WIFA 意图组监督微调,缓解包装式越狱与过度拒答
WIFA 是一种自动意图组数据构造,用来让安全微调拒绝有害意图而不是拒绝表面包装。WIFA-Boost 与 A-GCRT 在同一数据层上选取不同的安全–过拒工作点。
测量合成审稿训练导致的科学判断坍缩并提出 TrustReviewer 缓解
摘要一步递归里合成审稿会收窄判断。
形式化视频透视头显中系统截图与人眼视野的错配
提出主题锚点投毒,放大众包微调后的专有指令提取
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。