跳到正文
10月10日 · 周六

全部论文

找到 35 篇

另有 190 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.11773

    研究提出 Agent 安全新维度:识别未履行的安全义务

    提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务

    发表
    被测模型
    ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
    摘要义务是护栏缺口。

    作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。

    深度解读完整解读
  2. 评测与基准arXiv 2610.07939

    CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出

    提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别

    发表
    被测模型
    C2P-CLIP、ForgeLens、D3-Im 等 10 个

    摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。

    深度解读完整解读
  3. 评测与基准arXiv 2610.07519

    论文提出针对手语翻译与儿童安全过滤交叉地带的部署前审计框架

    提出手语转文本接入儿童安全过滤的部署前审计协议

    发表
    摘要作者提议聋人知情的部署前审计,以检查手语转文本是否改变儿童安全决策。

    手语儿童到达基于文本的儿童安全机制时,机制看到的是机器翻译,不是儿童所做的手语。作者要解决的是:这条边界在部署前应如何审计。

    深度解读完整解读
  4. 评测与基准arXiv 2610.03470

    CorrectGuard 提出黑盒安全护栏的免查看正确性估计框架

    提出 CorrectGuard,在不可查看输入上估计黑盒护栏决策对错

    发表
    被测模型
    Granite Guardian 3.1 2B、Qwen3Guard 8B、GPT-OSS-Safeguard-20B 等 7 个
    摘要CorrectGuard 用外部模型估计黑盒护栏决策对错,排序和弃权可用,校准在偏移下变差。

    CorrectGuard 面向不能人工检查生产输入、也没有生产标签的黑盒安全护栏,用外部模型估计单条决策是否正确,并据此排序和弃权。离线基准会随数据和攻击变化,未必代表生产分布。隐私约束还可能禁止模型查看原文或可反演的稠密嵌入。

    深度解读完整解读
  5. 评测与基准arXiv 2610.03434

    Persona Guardrail:面向智能体系统的生产级防御框架

    提出 Persona Guardrail,强制客服智能体守住功能边界

    发表
    场景
    AI Agent
    攻击者
    黑盒
    被测模型
    Qwen3-30B-A3B、Qwen3-VL-30B、Qwen3-8B 等 5 个
    摘要Persona Guardrail 用功能边界做同步输入输出校验,并在 PAGE 与生产延迟预算下给出评测。

    Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。

    深度解读完整解读
  6. 评测与基准arXiv 2610.03448

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重测提示注入检测器在 Agent 工具输出上的检出与任务阻断

    发表
    场景
    AI Agent
    被测模型
    Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个

    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    深度解读完整解读
  7. 评测与基准arXiv 2610.02664

    论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束

    提出 STAR-Guard 双层防御,抑制长程 Agent 遗忘跨轮安全约束

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2 等 7 个

    摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。

    深度解读完整解读
  8. 评测与基准arXiv 2610.01508

    OverAct:衡量并缓解 LLM 工具调用智能体的主动越权取数

    发布 OVERACT 衡量工具智能体主动越权取数并评测 SELFAUDIT

    发表
    场景
    AI Agent
    被测模型
    Qwen3.6-Flash、Qwen3.6-Plus、Qwen3.7-Max 等 7 个
    摘要七模型普遍超额调用。

    七个来自四个家族的工具调用模型,在保守的字面授权准则下会检索超出请求的私人数据。作者把该行为称为 proactive over-authorization,用 OVERACT 做无 LLM 评审的测量,并用 SELFAUDIT 做不依赖 oracle 的执行前过滤。

    深度解读完整解读
  9. 评测与基准arXiv 2609.36849

    研究评估 GradSafe 在多轮对话中的越狱检测脆弱性

    评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性

    发表
    被测模型
    Llama 3.1 8B Instruct、Qwen2.5-7B-Instruct
    摘要CWS 显示不安全梯度在真实多轮流量中变弱,且随攻击族和模型而变。

    作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。

    深度解读完整解读
  10. 评测与基准arXiv 2609.36562

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险

    发表
    被测模型
    ThinkingGuard(Qwen3-VL-8B-Instruct)
    摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。

    这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。

    深度解读完整解读
  11. 评测与基准arXiv 2609.35557

    论文:容器、权限规则与沙箱都无法区分读取研究代码的是编译器还是编码 Agent

    评测容器、权限规则与沙箱能否区分编译器与编码 Agent 的文件读取

    发表
    摘要此 harness 表达不了编译器可读而智能体不可读,五条路径两边都不覆盖。

    作者在物理流求解器上检查一套编码智能体配置:编译器必须读本组材料与反应模型,这些字节又不得进入模型上下文或离开本机的记录。

    深度解读完整解读
  12. 评测与基准arXiv 2609.34862

    JEV 作为智能体轨迹安全评判器:与生成式 LLM 评判器的实证对比

    对比类型化评审与生成式评审对智能体轨迹的安全判定

    发表
    场景
    AI Agent
    被测模型
    JEV、GLM-5.2-Tencent、DeepSeek-V4-Flash 等 5 个
    摘要JEV 的四基准平均正类 F1 最高,延迟和估计费用更低,但分数据集与精确率有取舍。

    在已保存的工具使用智能体轨迹上,比较类型化评审 JEV 与四种生成式评审的回溯安全分类。

    深度解读完整解读
  13. 评测与基准arXiv 2609.32520

    IntentFlux 基准测量 LLM Agent 的意图漂移并给出 StateForge 修复方案

    提出 IntentFlux 测量 Agent 意图漂移并提出 StateForge 修复

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 4.7、DeepSeek V4 Pro、Gemini 3.5 Flash 等 9 个
    摘要INTENTFLUX 量化意图漂移,STATEFORGE 用显式状态部分缩小差距,但未回到单轮水平。

    这篇工作把“用户改口后,过时意图仍影响答案或工具动作”做成可评分的多轮失败,并试验在生成前显式维护活跃状态。

    深度解读完整解读
  14. 评测与基准arXiv 2609.29429

    Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886

    提出 RLCDAlignBench,零样本检测多种对齐失败

    发表
    被测模型
    Jev (jev-1.13.0)
    摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。

    RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。

    深度解读完整解读