跳到正文
10月10日 · 周六

全部论文

找到 86 篇

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.12361

    研究:法律推理模型引用法条不等于依据法条

    用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条

    发表
    被测模型
    Qwen3-8B、Qwen3-14B、Llama-3.1-8B 等 7 个
    摘要作者通过依据置换反事实与内部承诺追踪发现法律 CoT 裁决对依据依赖度有限,且易受提示注入操纵。

    本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。

    深度解读完整解读
  2. 防御arXiv 2610.10345

    SLDR:通过选择性层恢复与动态路由防御恶意微调

    提出 SLDR,用选择性层恢复与动态路由防御恶意微调

    发表
    攻击者
    黑盒
    被测模型
    Llama3.1-8B-Instruct、Llama3-8B-Instruct、Qwen2.5-7B-Instruct 等 4 个
    摘要作者称 SLDR 能压低有害输出并保持下游效用。

    SLDR 是针对恶意微调的微调后防御:在已对齐模型上做有符号层探测,只在敏感分数最大与最小的两层训练 LoRA,再用 lmax 的最后 token 表示决定是否启用适配器。

    深度解读完整解读
  3. 防御arXiv 2610.09941

    OrthoPurify 用一步正交投影净化被后门污染的视觉语言模型

    提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向

    发表
    被测模型
    LLaVA-1.5-7B、Qwen3-VL-8B、LLaVA-1.5-13B 等 5 个
    摘要一次投影去掉劫持方向。

    OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。

    深度解读完整解读
  4. 攻击arXiv 2610.09819

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门

    发表
    被测模型
    HuBERT-base、WavLM-base

    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    深度解读完整解读
  5. 分析与理论arXiv 2610.09667

    东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

    揭示推理模型用标识符规则替代随机抽样,使审计可被预测

    发表
    被测模型
    GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个

    摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。

    深度解读完整解读
  6. 可解释性arXiv 2610.09087

    U-Space:揭示语言模型不确定性何时与为何产生

    提出 U-SPACE 与 U-LENS,从残差流估计推理轨迹不确定性

    发表
    被测模型
    Gemma-4-31B-it、Qwen3.5-27B、Magistral-Small-2507
    摘要U-SPACE 与 U-LENS 用语义方向和预测熵读推理不确定性,长度控制后仍高于所比基线。

    U-SPACE 与 U-LENS 是面向推理模型的无训练读出:用语义方向定位不确定性的形式,并用一个轨迹分数区分更可能错的回答。

    深度解读完整解读
  7. 分析与理论arXiv 2610.09004

    研究:去除有害信息不足以证明开源权重模型的抗篡改能力

    论证发布时互信息不能认证开源权重抗微调恢复

    发表
    被测模型
    EleutherAI/deep-ignorance-e2e-strong-filter、EleutherAI/deep-ignorance-unfiltered、Google BERT-Tiny 等 6 个
    摘要作者称零信息仍可一步恢复,表观抗微调可来自参数化。

    作者研究开源权重模型的篡改抵抗:发布时的互信息是否足以保证微调恢复很慢。

    深度解读完整解读
  8. 防御arXiv 2610.08761

    VeriFine:通过扩展验证实现具身推理的自我改进

    提出 VeriFine,用双环协同扩展验证以实现具身推理自我改进

    发表
    被测模型
    Alpamayo 1.5 8B、Qwen3-VL 2B、Claude Opus 5
    摘要VeriFine 用双环协同演化具身推理的策略、课程和评审,驾驶与导航的策略分和评审对齐都上升。

    VeriFine 把驾驶和导航推理的自改进写成策略、课程和无参考评审的协同演化,用来处理固定评审跟不上新失败模式的问题。

    深度解读完整解读
  9. 攻击arXiv 2610.07723

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    发表
    被测模型
    Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    深度解读完整解读
  10. 攻击arXiv 2610.07654

    研究揭示策略蒸馏的安全后门风险

    测量带后门教师经 OPD 向干净学生迁移潜伏后门

    发表
    被测模型
    Qwen2.5-1.5B-Instruct、Qwen2.5-3B-Instruct、Qwen2.5-7B-Instruct
    摘要作者称 OPD 可在压低无触发词有害率时迁入后门。

    带后门的外部教师经 OPD,可在压低无触发词有害率的同时,把触发条件下的有害行为传给初始干净学生。。

    深度解读完整解读
  11. 可解释性arXiv 2610.07518

    TRACE:仅凭 checkpoint 更新审计大语言模型有害目标

    提出 TRACE,仅凭检查点更新审计有害合规微调目标

    发表
    被测模型
    Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Qwen3-8B 等 6 个
    摘要作者称有害合规 SFT 在检查点更新中留下可排序坐标,并据此做只读权重审计。

    作者在检查点更新里寻找有害合规 SFT 的目标组成,并把读数做成不查询模型、不看未知训练数据的审计分 TRACE。

    深度解读完整解读
  12. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞

    发表
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  13. 攻击arXiv 2610.05453

    研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私

    提出 PLW,用微调把先前对话敏感触发编码进后续生成图像

    发表
    被测模型
    OmniGen2、BAGEL-7B

    摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。

    深度解读完整解读
  14. 评测与基准arXiv 2610.02741

    研究系统评估循环语言模型的思维链可监控性

    系统评估循环语言模型加深 loop 后的 CoT 可监控性

    发表
    被测模型
    Ouro-1.4B-Thinking、Ouro-2.6B-Thinking、Nanbeige4.2-3B 等 4 个
    摘要加深 loop 可在部分压力测试任务降低可监测性,循环架构本身并不必然更难监测。

    这项工作评估 LoopLM 的 CoT 可监测性:加深共享层的重复次数,以及“有循环结构”本身,会不会让决策关键因素更少出现在可监测文本里。

    深度解读完整解读
  15. 分析与理论arXiv 2610.02015

    研究:RLVR 后训练在全新推理任务上引发语言漂移

    证明 RLVR 后训练允许无界语言漂移且限制漂移必限制奖励

    发表
    被测模型
    gemma-3-1b-pt、Llama-3.2-1B、Qwen2.5-1.5B
    摘要论文证明并验证了 RLVR 在新任务上必然诱发独特的语言漂移,揭示了前沿推理模型可监控性的安全隐患。

    论文从理论与实验两方面研究了大语言模型在 RLVR 后训练过程中思维链出现的语言漂移现象。

    深度解读完整解读
  16. 攻击arXiv 2610.03124

    研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效

    提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测

    发表
    攻击者
    黑盒、白盒
    被测模型
    Llama2 (7B)、Llama3 (8B)、Qwen2.5 (7B)
    摘要作者用 UNTAG 评估 trigger-tag,认为其不能充当开放权重滥用检测的主要边界。

    UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。

    深度解读完整解读
  17. 风险行为arXiv 2610.03458

    论文:低监控读数不能证明行为受控

    检验低监控读数能否证明代码生成中的奖励作弊已受控

    发表
    被测模型
    Llama-3.1-8B-Instruct
    摘要论文指出监控器训练读数接近零无法确立作弊受控,模型可利用通用外壳推迟提交绕过监控,强化学习亟需带外行为验证。

    本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。

    深度解读完整解读