跳到正文
10月10日 · 周六

全部论文

找到 32 篇

另有 242 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.11773

    研究提出 Agent 安全新维度:识别未履行的安全义务

    提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务

    发表
    被测模型
    ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
    摘要义务是护栏缺口。

    作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。

    深度解读完整解读
  2. 评测与基准arXiv 2610.11112

    EpiReal-Bench:商用图像生成模型虚假声明红队基准

    构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据

    发表
    攻击者
    黑盒
    被测模型
    GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
    摘要四款商用图像模型能把假主张画成可信证据。

    EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。

    深度解读完整解读
  3. 评测与基准arXiv 2610.08902

    论文提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    发表
    被测模型
    Claude Fable 5、Claude Opus 5、GPT-5.6 Sol 等 10 个
    摘要作者用固定权重协议比较前沿模型把经验写成制品后的留出增益与习得效率。

    作者用 agent plasticity 衡量一件事:权重冻结时,智能体把经验写成可继承制品,再换成留出能力增益,这个转换有多省。

    深度解读完整解读
  4. 评测与基准arXiv 2610.07939

    CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出

    提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别

    发表
    被测模型
    C2P-CLIP、ForgeLens、D3-Im 等 10 个

    摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。

    深度解读完整解读
  5. 评测与基准arXiv 2610.04737

    PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督

    提出 PyINE 基准,训练捷径跟随模型并比较监督者

    发表
    被测模型
    shortcut-following model organism、gpt-4o、gpt-5 等 12 个
    摘要PyINE 用可验证代码执行研究捷径失败的监督覆盖与成本权衡。

    PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。

    深度解读完整解读
  6. 评测与基准arXiv 2610.03470

    CorrectGuard 提出黑盒安全护栏的免查看正确性估计框架

    提出 CorrectGuard,在不可查看输入上估计黑盒护栏决策对错

    发表
    被测模型
    Granite Guardian 3.1 2B、Qwen3Guard 8B、GPT-OSS-Safeguard-20B 等 7 个
    摘要CorrectGuard 用外部模型估计黑盒护栏决策对错,排序和弃权可用,校准在偏移下变差。

    CorrectGuard 面向不能人工检查生产输入、也没有生产标签的黑盒安全护栏,用外部模型估计单条决策是否正确,并据此排序和弃权。离线基准会随数据和攻击变化,未必代表生产分布。隐私约束还可能禁止模型查看原文或可反演的稠密嵌入。

    深度解读完整解读
  7. 评测与基准arXiv 2609.39473

    FAME:用反事实推理评测自主智能体的虚假记忆

    提出 FAME,用反事实概念漂移评测智能体虚假记忆

    发表
    被测模型
    Llama-3B
    摘要FAME 用反事实引起的隐状态概念漂移,在出答案前区分忠实记忆与虚假记忆。

    FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。

    深度解读完整解读
  8. 评测与基准arXiv 2609.36849

    研究评估 GradSafe 在多轮对话中的越狱检测脆弱性

    评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性

    发表
    被测模型
    Llama 3.1 8B Instruct、Qwen2.5-7B-Instruct
    摘要CWS 显示不安全梯度在真实多轮流量中变弱,且随攻击族和模型而变。

    作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。

    深度解读完整解读
  9. 评测与基准arXiv 2609.36562

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险

    发表
    被测模型
    ThinkingGuard(Qwen3-VL-8B-Instruct)
    摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。

    这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。

    深度解读完整解读
  10. 评测与基准arXiv 2609.29429

    Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886

    提出 RLCDAlignBench,零样本检测多种对齐失败

    发表
    被测模型
    Jev (jev-1.13.0)
    摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。

    RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。

    深度解读完整解读
  11. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御

    发表
    攻击者
    黑盒
    被测模型
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  12. ACEA:面向红蓝队对抗的 LLM 协同演化测试平台

    提出红蓝对抗评测平台 ACEA,分开计量攻击强度与防御效果

    发表
    被测模型
    openai/gpt-4o、google/gemini-2.5-pro、google/gemma-3-27b-it 等 5 个
    摘要ACEA 用 ASAP 让红蓝对同一目标对打。

    ACEA 是让可插拔红队和蓝队共享一个目标 LLM 的对打场地,把攻击强度和防御效果分开记分。作者要补三处空缺:双方只能对着固定对手分开练。LLM judge 分不清真实泄露和幻觉,拦截后又看不到攻击有多强。

    深度解读完整解读
  13. DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    被测模型
    Wan、CogVideoX、LTX-Video 等 9 个
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  14. SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准

    提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性

    发表
    被测模型
    GPT-5.4 mini、GPT-5.5、DeepSeek V4 Flash 等 12 个
    摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。

    SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。

    深度解读完整解读
  15. 论文发现安全监控器主要拦截模型本就会拒答的请求

    评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检

    发表
    被测模型
    Gemma-4-31B-IT、Qwen3-32B、Llama Guard 3 8B 等 6 个

    摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。

    深度解读完整解读