跳到正文
10月10日 · 周六

全部论文

找到 45 篇

另有 193 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.11766

    研究提出意图恢复率作为 LLM 安全评测的补充指标

    提出 IRIS,用意图恢复率区分遮蔽越狱下无害输出的原因

    发表
    被测模型
    GPT-4o、Claude Sonnet 4.5、Claude Opus 4.5 等 6 个
    摘要无害输出的证据权重取决于任务是否被恢复。

    IRIS 把意图恢复当作中间信号,用来解释意图遮蔽提示下为何没有出现有害协助。

    深度解读完整解读
  2. 评测与基准arXiv 2610.11005

    研究:叙事包装可跨语言绕过 LLM 拒答

    提出 GUISE 基准与 AXIS 训练,防御叙事包装越狱

    发表
    被测模型
    Qwen3-1.7B、Qwen3-4B、GLM-4-9B
    摘要GUISE 分开测包装与语域。

    作者测量叙事包装下的拒答失效,并训练一个在未见包装上拒绝、同时仍回答同风格良性请求的适配器。问题是:安全对齐模型拒绝直说的有害请求,却回答嵌进角色或叙事里的同一请求。文言文被用来把语域和包装拆开。

    深度解读完整解读
  3. 评测与基准arXiv 2610.09033

    研究发布 ASRD 数据集,评测五款开源模型在非规范输入下的安全表现

    发表
    被测模型
    Gemma 2 9B、Gemma 3 4B、Llama 3.1 8B 等 6 个
    摘要五模型、七族表面形式的四态评测里,低有害遵从不等于读懂后的安全处理。

    ASRD 用四态标签检查五个开源模型如何处理非规范表面上的有害请求。

    深度解读完整解读
  4. 评测与基准arXiv 2610.07089

    研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹

    提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视

    发表
    场景
    AI Agent
    被测模型
    Gemma 4 26B-A4B、Qwen3.6 27B、Qwen3.5 27B 等 12 个

    摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。

    深度解读完整解读
  5. 评测与基准arXiv 2610.03938

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测 ReAct 工具调用对多模态模型拒答有害请求的削弱

    发表
    场景
    AI Agent
    被测模型
    Gemini-2.5-Pro、Gemini-3.1-Pro-Preview、Claude Opus 4.6 等 13 个
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    深度解读完整解读
  6. 评测与基准arXiv 2610.03434

    Persona Guardrail:面向智能体系统的生产级防御框架

    提出 Persona Guardrail,强制客服智能体守住功能边界

    发表
    场景
    AI Agent
    攻击者
    黑盒
    被测模型
    Qwen3-30B-A3B、Qwen3-VL-30B、Qwen3-8B 等 5 个
    摘要Persona Guardrail 用功能边界做同步输入输出校验,并在 PAGE 与生产延迟预算下给出评测。

    Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。

    深度解读完整解读
  7. 评测与基准arXiv 2610.02827

    MLCommons 发布 Jailbreak Benchmark v1.0

    构建 MLCommons 越狱基准以测量模型的单轮越狱韧性

    发表
    被测模型
    Gemma 3N E4B Instruct、LFM2-24B-A2B、Qwen 2.5 7B Instruct Turbo 等 8 个

    摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。

    深度解读完整解读
  8. 评测与基准arXiv 2609.36849

    研究评估 GradSafe 在多轮对话中的越狱检测脆弱性

    评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性

    发表
    被测模型
    Llama 3.1 8B Instruct、Qwen2.5-7B-Instruct
    摘要CWS 显示不安全梯度在真实多轮流量中变弱,且随攻击族和模型而变。

    作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。

    深度解读完整解读
  9. 评测与基准arXiv 2609.36562

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险

    发表
    被测模型
    ThinkingGuard(Qwen3-VL-8B-Instruct)
    摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。

    这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。

    深度解读完整解读
  10. 评测与基准arXiv 2609.35902

    QH-Bench:面向中国青少年内容安全的细粒度中文基准

    构建中文青少年内容安全基准 QH-Bench,评测单轮与多轮回复的安全与有用性

    发表
    被测模型
    InternLM2.5-20B、InternLM2.5-7B、InternLM2.5-1.8B 等 13 个
    摘要QH-Bench 分单轮与多轮评测中文青少年内容安全,总均分高仍不消除线下接触和关系压力上的负分。

    QH-BENCH 是面向中国社会文化情境的中文青少年内容安全基准,用单轮细粒度风险和多轮跨轮机制两条轨道,评测模型回复是否既守住安全边界又提供适合年龄的帮助。

    深度解读完整解读
  11. 评测与基准arXiv 2609.33640

    SafeMol:分子多模态模型的双模态安全对齐

    提出 SafeMol,联合对齐分子多模态模型的文本与图输入

    发表
    攻击者
    黑盒
    被测模型
    Omni-Mol v2、ReactXT、SafeMol
    摘要SafeMol 用 MMD 和双分类头对齐分子多模态模型,在 Omni-Mol v2 上压低图条件攻击成功。

    SafeMol 研究分子多模态模型在危险分子相关请求上的安全对齐,并同时看过拒和任务效用。

    深度解读完整解读
  12. 评测与基准arXiv 2609.32547

    研究者提出预算受限的 LLM 重复评测框架,优先深挖隐藏失败

    提出预算化发现框架,优先深评更可能隐藏失败的安全提示词

    发表
    被测模型
    Qwen 2.5 7B、Qwen/Qwen2.5-7B-Instruct-Turbo、Gemma 3n E4B 等 4 个
    摘要浅层零失败的提示词仍可按潜在失败倾向排序,从而把有限深评预算投向更可能暴露隐藏失败之处。

    作者把 LLM 可靠性评测写成预算约束下的隐藏失败发现:每条提示词有未知的逐次失败概率,浅层少量采样中的零失败并不等于该概率为零。

    深度解读完整解读
  13. 评测与基准arXiv 2609.27336

    CART:面向大语言模型的闭环自适应红队框架

    提出闭环自适应红队框架 CART,评测模型与 Agent 的安全失败

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 4.8、GPT-5.5、Grok 4.3 等 7 个
    摘要CART 把红队做成可审计的闭环搜索,在三类评测上比静态回放发现更多失败与更高平均风险。

    CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。

    深度解读完整解读
  14. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御

    发表
    攻击者
    黑盒
    被测模型
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  15. DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    被测模型
    Wan、CogVideoX、LTX-Video 等 9 个
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  16. AV-SafetyBench:面向文本到音视频生成的安全基准

    提出 AV-SafetyBench 评测文生音视频模型的不安全生成

    发表
    被测模型
    LTX-2.3、Ovi-1.1、JavisDiT++ 等 7 个
    摘要AV-SafetyBench 用三视角评五个 T2AV 模型,显示只看视频会漏掉音频与联合风险。

    AV-SafetyBench 是面向文本生成音视频(T2AV)的安全基准:一条提示词同时规定画面和音频,评测同时看两轨以及它们的交互。作者要测的是,不安全含义不只出现在画面上:它可以主要由语音或声音承载,也可以只有两轨合起来才成立。T2VSafetyBench 不评音频,TTA-Bench 不评与画面的交互,作者认为二者都盖不住这些路径。

    深度解读完整解读