跳到正文
10月9日 · 周五

全部论文

找到 23 篇

另有 702 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2610.08670

    研究:后训练配方决定大模型是否违背自身道德判断行事

    提出知行差距面板,测量压力下模型是否违背自身判断

    发表
    测试
    OLMo-3-7B-Instruct、Tulu 3、OLMo-3-7B 等 7 个
    摘要评估发现后训练配方决定知行差距是否存在,行动前审思可有效缓解。

    本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。

    深度解读完整解读
  2. 可解释性arXiv 2610.04125

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    揭示风险自述与实际行为由近正交表征分别控制

    发表
    测试
    OLMo-3-7B-Instruct、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 等 4 个
    摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。

    深度解读完整解读
  3. 风险行为arXiv 2605.28591

    研究:模型掌握评测设计知识后安全基准分数更高

    微调注入评测特征知识,测量隐式评测觉察造成的安全分数虚增

    发表
    场景
    AI Agent
    测试
    OLMo 3.1 32B Instruct、Llama 3.3 Nemotron Super 49B v1.5、Qwen3 32B 等 5 个
    摘要证实模型通过合成文档内化评测特征后可在无显式觉察下大幅提升安全评分。

    这篇论文研究了大语言模型因学习评测设计元知识而诱发的隐式评估觉察及安全评分虚增现象。

    深度解读完整解读
  4. 评测与基准arXiv 2610.00568

    研究提出对齐诱导不忠实:对齐训练让模型静默改写输入内容

    提出 FAITHCONFLICT,测量对齐训练导致模型静默改写相悖输入

    发表
    测试
    Tulu-3-8B、Tulu-3-70B、OLMo-3-7B 等 13 个
    摘要论文揭示并系统分析了大语言模型在安全与常识冲突下静默背离输入的 AIU 现象与三元冲突困境。

    本文系统揭示并实证分析了语言模型后训练中存在的“能力–安全–忠实度”三元冲突。

    深度解读完整解读
  5. 可解释性arXiv 2609.14759

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    发表
    测试
    OLMo-3-7B-Instruct、OLMo-3-7B base、OLMo-3-Think 等 9 个
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    深度解读完整解读
  6. 评测与基准arXiv 2609.35312

    MemoReason 基准

    提出 MemoReason 基准,测量参数记忆对上下文推理的影响

    发表
    测试
    OLMo-3-7B-Think、OLMo-3-7B-Instruct、GPT-OSS-20B 等 9 个
    摘要配对的虚构替换显示熟悉度影响推理,但模型很少直接抄回事实答案。

    MemoReason 用结构相同的事实–虚构文档配对,测量参数记忆如何影响大模型的上下文推理。

    深度解读完整解读
  7. 分析与理论arXiv 2607.12649

    研究者提出可提取记忆的匹配比较检验方法

    提出匹配比较校准,界定生成训练序列何时算可抽取记忆

    发表
    测试
    OLMo 2 32B base、OLMo 2 32B Instruct、OLMo 2 7B 等 7 个
    摘要匹配非成员校准阈值后,短序列抽取含大量假阳性,极低概率过阈值也不等于可抽取。

    Cooper 等人从第一性原理重写 extractable memorization:生成训练文本只有在概率高过匹配非训练文本的可预测性基线时,才支持记忆声称。

    深度解读完整解读
  8. 可解释性arXiv 2608.21766

    研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关

    用探针与激活导向分析语言模型的评测意识表征及言语化

    发表
    测试
    Olmo3-7B、Olmo3-32B、Olmo3-7B Base 等 14 个

    摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。

    深度解读完整解读
  9. 防御arXiv 2608.30703

    SingProbe 发布开源内在护栏框架,适配 29 个开源模型

    提出内生护栏 SingProbe,复用解码隐状态监测查询意图、回复安全与幻觉

    发表
    测试
    WildGuard、Ling-3.0-tiny-singprobe、Ling-3.0-flash-singprobe 等 14 个
    摘要SingProbe 用轻量内生探针做生成时三类监测,并给出流式基准与低开销服务接入。

    SingProbe 是面向生成时监测的开源内生护栏:复用基座解码隐状态,而不是另起模型反复编码文本。

    深度解读完整解读
  10. 分析与理论arXiv 2609.36477

    研究发现护栏模型在基座模型不确定处过度自信

    诊断护栏相对基座在对抗提示上的置信失校

    发表
    测试
    WildGuard 7B、Llama-Guard 7B、Llama-Guard-2 8B 等 10 个
    摘要对抗包装使 guard 高置信漏检,而对应 base 在同一输入上常更不确定。

    诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。

    深度解读完整解读
  11. 可解释性arXiv 2610.01821

    研究者提出非线性概念流形发现与对齐方法,用于分析大语言模型内部表示

    提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构

    发表
    测试
    Tulu-3-8B-SFT、Tulu-3-8B-DPO、Tulu-3-8B-Final (RLVR) 等 9 个
    摘要NLMCD-NLP 用 CBA 比较非线性概念,层块、语言共享和微调漂移都随模型与阶段而变。

    NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。

    深度解读完整解读
  12. 可解释性arXiv 2609.06934

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练

    发表
    测试
    OLMo-2-0425-1B、OLMo-2-1B-Instruct、Qwen-2.5-7B 等 15 个

    摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    深度解读完整解读
  13. 可解释性arXiv 2609.18612

    研究揭示 Transformer 中影响超常的削弱型神经元

    用权重余弦给 GLU 神经元做读写功能分类并检验消融影响

    发表
    测试
    OLMo-7B-0424、Gemma-2-2B、Gemma-2-9B 等 9 个
    摘要GLU 神经元的读写余弦呈现先加强后削弱的层模式,晚期少量 weakening 神经元对输出影响大。

    这篇分析工作用输入权重与输出权重的余弦,给 GLU 神经元的读写功能分类,并检查这些类的层分布、激活频率和对下一 token 分布的影响。

    深度解读完整解读