跳到正文
10月9日 · 周五

全部论文

找到 41 篇

另有 643 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.10276

    PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤

    提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤

    发表
    测试
    gemma-3-4b-it、gemma-3-12b-it、Qwen2.5-3B-Instruct 等 8 个

    摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。

    深度解读完整解读
  2. Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现

    构建 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点

    发表
    测试
    Gemini 3.1 Pro、Claude Opus 4.6、Claude Opus 4.7 等 6 个

    摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。

    深度解读完整解读
  3. 评测与基准arXiv 2610.06522

    SycoLens 研究:单一谄媚翻转率掩盖纠正与屈从的区别

    构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从

    发表
    测试
    gemini-3.1-pro、gemini-3.5-flash、gemini-3.1-flash-lite 等 11 个
    摘要论文揭示施压句式、边界距离与格式偏置主导翻转率,提出系统解构纠错与顺从的综合评测方案。

    本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。

    深度解读完整解读
  4. 评测与基准arXiv 2610.00568

    研究提出对齐诱导不忠实:对齐训练让模型静默改写输入内容

    提出 FAITHCONFLICT,测量对齐训练导致模型静默改写相悖输入

    发表
    测试
    Gemma-3-12B、Gemma-3-27B、Llama-3.1-8B-Instruct 等 13 个
    摘要论文揭示并系统分析了大语言模型在安全与常识冲突下静默背离输入的 AIU 现象与三元冲突困境。

    本文系统揭示并实证分析了语言模型后训练中存在的“能力–安全–忠实度”三元冲突。

    深度解读完整解读
  5. SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    提出 SkillSafe-Bench,评测技能合并模型的自适应越狱鲁棒性

    发表
    测试
    Gemma-2-9B、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 等 6 个
    摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。

    深度解读完整解读
  6. 论文发现安全监控器主要拦截模型本就会拒答的请求

    评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检

    发表
    测试
    Gemma-4-31B-IT、Qwen3-32B、Llama Guard 3 8B 等 6 个

    摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。

    深度解读完整解读
  7. 评测与基准arXiv 2609.35312

    MemoReason 基准

    提出 MemoReason 基准,测量参数记忆对上下文推理的影响

    发表
    测试
    Gemma-4-26B-A4B-it、GPT-OSS-20B、GPT-OSS-120B 等 9 个
    摘要配对的虚构替换显示熟悉度影响推理,但模型很少直接抄回事实答案。

    MemoReason 用结构相同的事实–虚构文档配对,测量参数记忆如何影响大模型的上下文推理。

    深度解读完整解读
  8. 研究提出 Fact-Ablated Evaluation,揭示 LLM 事实核查更依赖参数知识

    提出 FAE 衡量事实核查对证据的依赖,并用 REAL 训练这种依赖

    发表
    测试
    Gemini-2.5-flash-lite、GPT-4o-mini、Qwen-2.5-32B-Instruct 等 7 个
    摘要FAE 用多轮证据消融测接地,REAL 用对比监督让判决随证据可用性改变。

    FAE 与 REAL 分别用来测量并训练 LLM 事实核查器对所给证据的依赖,而不只看一次性的标签准确率。

    深度解读完整解读
  9. 评测与基准arXiv 2609.32763

    Mandela-Bench:36 个多模态模型更依赖记忆而非观察图像

    构建 Mandela-Bench,评测多模态模型是否凭记忆接受篡改图像

    发表
    测试
    Gemini-3.8-Flash、Gemma-4-31B、GPT-5.6 等 15 个
    摘要论文构建 Mandela-Bench 发现模型对经典图像存在记忆重构偏见,过度依赖先验导致无法有效利用知识核验事实篡改。

    该研究系统评估了多模态大语言模型在面对无痕事实性编辑时,能否利用自身内在世界知识核验被识别出的经典图像。

    深度解读完整解读
  10. SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准

    提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性

    发表
    测试
    Gemini 3.1 Pro Preview、Gemini 3.5 Flash、GPT-5.4 mini 等 12 个
    摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。

    SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。

    深度解读完整解读
  11. 评测与基准arXiv 2609.15939

    VLoc Bench 发布:评测 Agent 在完整仓库中的漏洞定位能力

    提出 VLoc Bench,评测智能体仅凭弱点类型在完整仓库中定位漏洞

    发表
    测试
    Gemini 3 Pro、Gemini 2.5 Flash、Gemini 3.1 Flash Lite 等 15 个

    摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。

    深度解读完整解读
  12. PatchBench:马里兰大学团队发布 C/C++ 漏洞修补评测基准

    提出 PATCHBENCH,评测编程智能体对 C/C++漏洞的真实修补能力

    发表
    测试
    OpenHands + Gemini 3.5 Flash、OpenHands + Gemini 3.1 Pro、Codex + GPT-5.6 Sol 等 11 个

    摘要论文揭示漏洞修复评测的记忆与表面防护问题,提出离栈变异基准与双重验证,测得智能体实际解决率仅约五成。

    深度解读完整解读
  13. 评测与基准arXiv 2609.32547

    研究者提出预算受限的 LLM 重复评测框架,优先深挖隐藏失败

    提出预算化发现框架,优先深评更可能隐藏失败的安全提示词

    发表
    测试
    Gemma 3n E4B、google/gemma-3n-E4B-it、Qwen 2.5 7B 等 6 个
    摘要浅层零失败的提示词仍可按潜在失败倾向排序,从而把有限深评预算投向更可能暴露隐藏失败之处。

    作者把 LLM 可靠性评测写成预算约束下的隐藏失败发现:每条提示词有未知的逐次失败概率,浅层少量采样中的零失败并不等于该概率为零。

    深度解读完整解读
  14. 评测与基准arXiv 2610.01428

    SAGO:从稳定性而非准确率出发的多维度大模型泛化评测

    提出 SAGO,以语义等价变体上的逐例行为稳定性评测大模型泛化

    发表
    测试
    Gemma-2B-IT、Gemma-7B-IT、Gemma-4-E4B-IT 等 11 个
    摘要SAGO 用多轴逐例稳定性替代聚合准确率,十一个模型都未均匀泛化,且排名会随数据集改变。

    SAGO 把 LLM 泛化改写成同一目标与上下文在语义等价表达下的逐例行为稳定性,而不是单一基准上的聚合准确率。。

    深度解读完整解读
  15. 评测与基准arXiv 2609.39863

    FIGS:在不惩罚共情的前提下评测多轮谄媚

    提出 FIGS 双轴基准,评测多轮对话中的谄媚与校准性共情

    发表
    测试
    Gemini 3.8 Flash、DeepSeek V4.1 Flash、GLM 5.3 等 8 个
    摘要FIGS 把守事实和恰当共情分开计分,事实向提示会换来更冷的失败。

    FIGS 是一个固定的多轮评测套件,用来同时看模型会不会在压力下放弃事实,以及会不会在守住事实时忽略用户实际说过的感受。

    深度解读完整解读