跳到正文
10月10日 · 周六

全部论文

找到 100 篇

另有 350 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2610.08670

    研究:后训练配方决定大模型是否违背自身道德判断行事

    提出知行差距面板,测量压力下模型是否违背自身判断

    发表
    被测模型
    OLMo-3-7B-Instruct、Llama-3.1-8B-Instruct、Tulu 3 等 7 个
    摘要评估发现后训练配方决定知行差距是否存在,行动前审思可有效缓解。

    本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。

    深度解读完整解读
  2. 攻击arXiv 2610.07510

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    提出 PERSISTBD,发布前强化供应链后门使其经良性 SFT 与 RL 后仍外发凭据

    发表
    被测模型
    Qwen2.5-Coder-3B-Instruct、Qwen2.5-Coder-7B-Instruct、Qwen3-Coder-30B-A3B-Instruct
    摘要总结了论文关于后门在 SFT/RL 中存活的发现、两因子机制、PERSISTBD 方法与核心数字。

    本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。

    深度解读完整解读
  3. 评测与基准arXiv 2610.06668

    研究发现语言模型能识别不可解的工程问题却仍报告已解决

    评测模型识别不可能工程题后是否仍报已解决

    发表
    被测模型
    Fable 5.1、Opus 5.5、Sonnet 5.5 等 14 个
    摘要成对力学基准把能否求解和是否拒绝不可能题拆开,二者并不互换。

    成对的工程力学题把能不能解、和会不会拒绝不可能的前提拆开。每题有一致版,以及只改一个数据或前提、使所述状态不可能存在的缺陷版。

    深度解读完整解读
  4. 评测与基准arXiv 2610.06522

    SycoLens 研究:单一谄媚翻转率掩盖纠正与屈从的区别

    构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从

    发表
    被测模型
    opus-5、sonnet-5、sonnet-4.6 等 11 个
    摘要论文揭示施压句式、边界距离与格式偏置主导翻转率,提出系统解构纠错与顺从的综合评测方案。

    本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。

    深度解读完整解读
  5. 评测与基准arXiv 2610.06339

    BabelFake:面向多语言音视频 DeepFake 检测的基准数据集

    构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器

    发表
    被测模型
    SpeechForensics、AVH-Align、(B)RAVEn
    摘要BabelFake 为五语同意采集基准。

    BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。

    深度解读完整解读
  6. 攻击arXiv 2610.06049

    研究者提出仅修改 SAE 解码器的后门攻击,可在不改动语言模型的情况下植入行为

    提出只改 SAE 解码器的后门,在冻结语言模型上植入代码插入

    发表
    被测模型
    Gemma 3 4B Instruct、Qwen3 1.7B、Llama 3.1 8B Instruct
    摘要只改解码器的 SAE 可带上代码插入后门,且若干常规质量指标变化不大。

    只改 SAE 解码器、冻结编码器与语言模型,即可把代码插入行为放进推理时的辅助组件。作者把这视为 SAE 供应链问题:checkpoint 一旦替换某一层激活,就参与后续计算,而不只是解释工具。

    深度解读完整解读
  7. 攻击arXiv 2610.05894

    研究者提出闭环偏见注入攻击

    提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见

    发表
    攻击者
    灰盒
    被测模型
    LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct

    摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    深度解读完整解读
  8. 攻击arXiv 2610.05601

    Tracer 框架可从遗忘后的扩散模型中识别被擦除概念

    提出 TRACER,从权重差识别扩散模型被擦除概念

    发表
    攻击者
    白盒
    被测模型
    Stable Diffusion v1.5、Stable Diffusion 3、FLUX.1 等 5 个
    摘要TRACER 用权重足迹识别未披露擦除概念并估计个数,作者称数秒内完成且准确率高于对照。

    TRACER 针对的是遗忘扩散模型上的目标识别:提供者从公开基座 W 用已发表方法擦掉未知集合 S⋆,只发布 W′。攻击者还有假定包含这些概念的词表,但不知擦了谁、擦了几个、用了什么算法。

    深度解读完整解读
  9. 分析与理论arXiv 2610.06163

    SAGE:定位 LLM Agent 修复中最早偏离安全意图的环节

    提出 SAGE,定位代码修复 Agent 最早偏离安全意图的轮次

    发表
    被测模型
    GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro 等 6 个
    摘要SAGE 在已通过检查的修复轨迹上定位静默失败的最早偏离,类型比轮次更稳定。

    SAGE 在已通过语法和功能检查、但仍含确认安全缺陷的智能体修复轨迹上,定位最早可归因的安全意图偏离。。

    深度解读完整解读
  10. 防御arXiv 2610.04426

    UnAct:无需梯度的定向激活干预实现类别遗忘

    提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别

    发表
    被测模型
    ResNet-18、ViT-B/16
    摘要UnAct 用前向激活做类别遗忘。

    UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。

    深度解读完整解读