跳到正文
10月10日 · 周六

全部论文

找到 86 篇

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.11005

    研究:叙事包装可跨语言绕过 LLM 拒答

    提出 GUISE 基准与 AXIS 训练,防御叙事包装越狱

    发表
    被测模型
    Qwen3-1.7B、Qwen3-4B、GLM-4-9B
    摘要GUISE 分开测包装与语域。

    作者测量叙事包装下的拒答失效,并训练一个在未见包装上拒绝、同时仍回答同风格良性请求的适配器。问题是:安全对齐模型拒绝直说的有害请求,却回答嵌进角色或叙事里的同一请求。文言文被用来把语域和包装拆开。

    深度解读完整解读
  2. 评测与基准arXiv 2610.10276

    PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤

    提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤

    发表
    被测模型
    Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it 等 8 个

    摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。

    深度解读完整解读
  3. 评测与基准arXiv 2610.09964

    研究比较连续训练阶段对大语言模型说服力的影响

    比较连续后训练阶段如何改变语言模型的说服力

    发表
    被测模型
    mlabonne/Meta-Llama-3.1-8B-Instruct-abliterated、GPT-4
    摘要作者称说服性 SFT 提高失调模型的态度变化,IPO 无额外收益,GPT-4 不异于中性文本。

    作者用同一人类协议,把 LLM 说服力拆成阴谋数据上的失调 SFT、说服数据上的 SFT,以及其后的 IPO。

    深度解读完整解读
  4. 评测与基准arXiv 2610.08540

    论文提出按风险类别测量的对齐缩放定律框架

    提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化

    发表
    被测模型
    Pythia (14m–2.8b)、Qwen2.5 (0.5B–72B)、Qwen2.5-Instruct (0.5B–14B) 等 4 个
    摘要论文提出了分风险对齐标度律框架,测得真实性与倾向纠错呈标度有益,但盲后门仍存活,揭示隐藏风险的长期挑战。

    本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。

    深度解读完整解读
  5. 评测与基准arXiv 2610.07762

    ES-Trace 审计 26 个代码模型的伦理采购披露,仅看 Model Card 平均得分 1.77/5

    提出 ES-Trace,审计代码生成模型模型卡内外的伦理来源披露

    发表
    被测模型
    santacoder、starcoder、CodeLlama-34b-Instruct-hf 等 19 个
    摘要顺着声明引用审计后披露分数上升,但社会与劳动方面仍然少有证据。

    ES-Trace 是一套参考感知的披露审计,用来测量代码生成模型的公开文档里能观察到多少 ES-CodeGen 证据。

    深度解读完整解读
  6. 评测与基准arXiv 2610.07722

    SteerScope:面向 LLM 引导方法的多维评测套件

    提出 SteerScope 多维评测 LLM 激活引导的功效与副作用

    发表
    被测模型
    Gemma-2-2B-it、Gemma-2-9B-it
    摘要作者称默认等权下,activation steering 未能在副作用不更大时超过 Prompt Steering。

    SteerScope 是一套 LLM steering 评测套件,用来同时记录目标概念有没有被诱导出来、模型还被连带改了什么,以及这些改变在换语言提示和减少训练样本后还剩多少。

    深度解读完整解读
  7. 评测与基准arXiv 2610.07362

    HARP:在硬资源约束下为 LLM 评测动态分配预算

    提出 HARP,在硬预算约束下为多轮评测动态分配交互并校准预测界

    发表
    被测模型
    Qwen 2.5 14B、Llama 3.1 8B、Phi-4 Mini 等 4 个
    摘要HARP 用分组预留与回流,在硬预算下校准多轮 time-to-event 界和指标。

    HARP 是硬计算预算下的多轮评测分配与校准方法,用来构造 time-to-event 预测界,并估计越狱率一类边际指标。

    深度解读完整解读
  8. 评测与基准arXiv 2610.06673

    语言模型合规性双探针诊断基准:Claude Sonnet-4.6 与 Opus-4.7 可被停止且不可被利用

    提出合规双探针基准,测量模型可利用性与可停止性

    发表
    被测模型
    Gemini 2.5 Flash Lite、Llama 3.3-70B、Qwen3-30B-A3B 等 12 个
    摘要两探针把十二个模型放上遵从平面:多数两边服从,只有两个 Claude 可停且不可利用。

    合规指数κ用来把语言模型放在“照做”和“推回”之间。

    深度解读完整解读
  9. 评测与基准arXiv 2610.06668

    研究发现语言模型能识别不可解的工程问题却仍报告已解决

    评测模型识别不可能工程题后是否仍报已解决

    发表
    被测模型
    Fable 5.1、Opus 5.5、Sonnet 5.5 等 14 个
    摘要成对力学基准把能否求解和是否拒绝不可能题拆开,二者并不互换。

    成对的工程力学题把能不能解、和会不会拒绝不可能的前提拆开。每题有一致版,以及只改一个数据或前提、使所述状态不可能存在的缺陷版。

    深度解读完整解读
  10. 评测与基准arXiv 2610.06522

    SycoLens 研究:单一谄媚翻转率掩盖纠正与屈从的区别

    构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从

    发表
    被测模型
    opus-5、sonnet-5、sonnet-4.6 等 11 个
    摘要论文揭示施压句式、边界距离与格式偏置主导翻转率,提出系统解构纠错与顺从的综合评测方案。

    本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。

    深度解读完整解读
  11. 评测与基准arXiv 2610.06339

    BabelFake:面向多语言音视频 DeepFake 检测的基准数据集

    构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器

    发表
    被测模型
    SpeechForensics、AVH-Align、(B)RAVEn
    摘要BabelFake 为五语同意采集基准。

    BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。

    深度解读完整解读
  12. 评测与基准arXiv 2610.04737

    PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督

    提出 PyINE 基准,训练捷径跟随模型并比较监督者

    发表
    被测模型
    shortcut-following model organism、gpt-4o、gpt-5 等 12 个
    摘要PyINE 用可验证代码执行研究捷径失败的监督覆盖与成本权衡。

    PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。

    深度解读完整解读