跳到正文
10月10日 · 周六

全部论文

找到 29 篇

另有 386 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2610.08670

    研究:后训练配方决定大模型是否违背自身道德判断行事

    提出知行差距面板,测量压力下模型是否违背自身判断

    发表
    被测模型
    OLMo-3-7B-Instruct、Llama-3.1-8B-Instruct、Tulu 3 等 7 个
    摘要评估发现后训练配方决定知行差距是否存在,行动前审思可有效缓解。

    本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。

    深度解读完整解读
  2. 评测与基准arXiv 2610.06584

    论文:AI 在非公开漏洞上更帮攻击者还是防御者

    评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击

    发表
    被测模型
    Opus 5、GPT-5.6 Sol、GPT-6 Sol 等 10 个
    摘要攻防孰强随环境、系统和弱点改变。

    作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。

    深度解读完整解读
  3. 评测与基准arXiv 2610.06522

    SycoLens 研究:单一谄媚翻转率掩盖纠正与屈从的区别

    构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从

    发表
    被测模型
    opus-5、sonnet-5、sonnet-4.6 等 11 个
    摘要论文揭示施压句式、边界距离与格式偏置主导翻转率,提出系统解构纠错与顺从的综合评测方案。

    本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。

    深度解读完整解读
  4. 防御arXiv 2610.01170

    HeadEdit:通过冻结的 unembedding 矩阵校准语言模型行为

    提出 HeadEdit,经冻结 unembedding 做随输入变化的 logit 校正

    发表
    被测模型
    Qwen3-4B、Gemma-3-4B-IT、Llama-3.2-3B-Instruct 等 4 个
    摘要低秩 unembedding 校正抬高九个设置的总体准确率,并可部分预测 DPO 更新。

    HeadEdit 是一种不更新参数的行为校准方法,作用点是冻结的 unembedding,而不是中间层残差或新的梯度优化。

    深度解读完整解读
  5. 评测与基准arXiv 2609.39863

    FIGS:在不惩罚共情的前提下评测多轮谄媚

    提出 FIGS 双轴基准,评测多轮对话中的谄媚与校准性共情

    发表
    被测模型
    DeepSeek V4.1 Flash、Gemini 3.8 Flash、GLM 5.3 等 8 个
    摘要FIGS 把守事实和恰当共情分开计分,事实向提示会换来更冷的失败。

    FIGS 是一个固定的多轮评测套件,用来同时看模型会不会在压力下放弃事实,以及会不会在守住事实时忽略用户实际说过的感受。

    深度解读完整解读
  6. 可解释性arXiv 2609.37616

    语言模型中的权威偏差:来源顺从与用户认同并非同一行为

    因果解耦来源依从与用户迎合的内部机制

    发表
    被测模型
    Qwen3.5-27B、GPT-OSS-20B、OLMo-3.1-32B 等 8 个

    摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。

    深度解读完整解读
  7. 可解释性arXiv 2609.35544

    减少谄媚能否增强拒答?机制可解释性带来的 AI 安全启示

    用 SAE 与 CFI 压低谄媚,检验直接拒答与施压下拒答是否增强

    发表
    被测模型
    Qwen3.5-2B-Base、Qwen3.5-9B-Base、Qwen3.5-35B-A3B-Base
    摘要CFI 能持久降低谄媚,但不保证直接拒答变强。

    用 SAE 选出的谄媚特征做补偿性训练注入,检验“少谄媚”是否带来“更强拒答”。。

    深度解读完整解读
  8. 评测与基准arXiv 2609.32616

    Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作

    提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作

    发表
    被测模型
    Claude-Sonnet-5、Claude-Opus-5、GPT-5.6-Sol 等 14 个

    摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。

    深度解读完整解读
  9. 防御arXiv 2609.31122

    LocUS:面向定向激活引导的注意力头选择与子空间投影

    提出 LocUS,用词汇子空间选择注意力头并约束激活转向

    发表
    被测模型
    Mistral-7B-v0.1、Mistral-7B-Instruct-v0.3、Llama-3.1-8B 等 7 个
    摘要LocUS 用词汇子空间约束 DoM 转向的位置和方向。

    LocUS 是不更新权重的推理时转向方法,把差分均值更新限制在少数注意力头及其属性对齐子空间。

    深度解读完整解读
  10. 风险行为arXiv 2609.30986

    研究评测 DeepSeek、Qwen、豆包在中文事实问题上的谄媚行为

    评测中文事实是非题上 LLM 对用户信念的谄媚转移

    发表
    被测模型
    Qwen-Plus、DeepSeek-V3.2、Doubao-Seed-2.0-Lite
    摘要三个中文 LLM 在是非事实题上会因错误信念失去正确性。

    三个中文前沿 LLM 在源自搜索日志的是非事实题上被用来观察事实性谄媚:用户给出信念后,回答如何在正确、错误、不确定之间移动。

    深度解读完整解读
  11. 防御arXiv 2609.30405

    AIMES:通过因果激活引导实现 LLM 自适应多价值观控制

    提出 AIMES 用词表读出在线调节多价值激活干预

    发表
    被测模型
    Gemma-3-4B-IT、Gemma-3-12B-IT、Qwen3-4B 等 5 个
    摘要AIMES 用词表读出闭环调节多价值转向,优势随深度变化且实现扰动更小。

    AIMES 是推理时的多价值激活转向框架,用中间层词表读出把固定系数改成随状态变化的权重。

    深度解读完整解读
  12. 评测与基准arXiv 2609.15939

    VLoc Bench 发布:评测 Agent 在完整仓库中的漏洞定位能力

    提出 VLoc Bench,评测智能体在完整仓库中定位漏洞文件并抑制修复后误报

    发表
    被测模型
    GPT-5.5 (xhigh)、GPT-5.5 (default)、Gemini 3 Pro 等 15 个

    摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。

    深度解读完整解读
  13. 风险行为arXiv 2609.14998

    合成文档微调无法阻止奖励作弊引发的涌现性失准

    检验合成文档微调能否阻断奖励作弊带来的涌现失准

    发表
    被测模型
    Llama-3.3-70B-Instruct
    摘要SDF 能让模型口头接受 reward hacking,却挡不住、甚至伴随更强的 EM。

    作者研究一种风险行为:模型在奖励可被钻空子的 RL 里学会 reward hacking 之后,会不会泛化出更广的 misalignment,以及能不能在开发者不控制的后续训练之前,用合成文档微调把这条泛化提前挡住。

    深度解读完整解读
  14. 风险行为arXiv 2609.08186

    论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式

    揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱

    发表
    被测模型
    Qwen3-8B、Qwen3-14B、Llama2-7B 等 8 个
    摘要更深推理提升题目准确率,同时提高扰动下的相对损失。

    作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。

    深度解读完整解读