跳到正文
10月9日 · 周五

全部论文

找到 116 篇

另有 516 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角

    发表
    测试
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B 等 6 个
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  2. 分析与理论arXiv 2610.09667

    东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

    揭示推理模型用标识符规则替代随机抽样,使审计可被预测

    发表
    测试
    GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个

    摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。

    深度解读完整解读
  3. 分析与理论arXiv 2610.08144

    新论文称 Lean 验证不能为 OpenAI 的 Navier-Stokes 自然语言证明背书

    论证 Lean 编译通过不能保证自然语言数学证明语义忠实

    发表
    测试
    ChatGPT-6 (Astra Ultra)、OpenAI Navier-Stokes formalisation AI、Meta Atlas autoformaliser

    摘要论文论证了形式化编译不保证原证明正确,确立了消歧不可计算性理论,并揭示了 OpenAI 爆破证明中的具体脱节。

    深度解读完整解读
  4. 可解释性arXiv 2610.08559

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    分析 LLM 去偏激活方向,发现其编码置信度而非公平性

    发表
    测试
    Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个

    摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。

    深度解读完整解读
  5. 可解释性arXiv 2610.04125

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    揭示风险自述与实际行为由近正交表征分别控制

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个
    摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。

    深度解读完整解读
  6. 可解释性arXiv 2610.03698

    DINOv2 中 register token 与高范数 patch token 的功能角色解析

    用 SAE 解析 ViT 中 register 与高范数 patch 的功能角色

    发表
    测试
    facebook/dinov2-small、facebook/dinov2-with-registers-small
    摘要register 特征更偏高层语义且消融影响大,outlier 更偏纹理且消融影响小。

    作者用 SAE 比较 DINOv2 中 register token 与高范数 outlier patch token 的语义和功能。register 能减少背景区高范数伪影,但两类 token 编码什么、特征是否分开、消融影响是否不同,此前没有充分建立。在 ImageNet-1k 上取 layer-8 激活:facebook/dinov2-small 用于 outlier 与 Base full,facebook/dinov2-with-registers-small 用于 register 与 Register full。

    深度解读完整解读
  7. 可解释性arXiv 2610.01495

    路由熵能否作为 Attention-Residual Transformer 的不确定性信号?一项审计研究

    审计路由熵是否在置信度之外仍携带预测正确性信息

    发表
    测试
    Swin-Tiny、DeiT-Small、ViT-B/16
    摘要打乱对照上的优势没有变成相对置信度的优势,且已知信号下探针只恢复一部分效应。

    这篇工作审计 Attention-Residual 视觉 Transformer 的路由熵,能否在模型自身输出之外充当不确定性信号。

    深度解读完整解读
  8. 分析与理论arXiv 2609.32004

    论文指出消除人口统计信息的不变性约束可能制造新偏见

    分析消除人口统计信息的不变性约束如何制造新偏见

    发表
    测试
    ERM、Fair Normalizing Flows、DenseNet121 等 7 个
    摘要表示不变性不是公平的充分条件。

    这篇分析考察的是:为了公平而从潜表示中去掉人口统计信息,是否可取、是否足够。作者认为,表示能解码出群体归属,本身并不解释不公平。任务特征可以与群体相关,患病率不同时,抹平边际分布会迫使错误率在群体间分开。

    深度解读完整解读
  9. 可解释性arXiv 2609.14759

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    发表
    测试
    OLMo-3-7B-Instruct、OLMo-3-7B base、Qwen2.5-7B-Instruct 等 9 个
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    深度解读完整解读
  10. 可解释性arXiv 2607.12166

    研究:SAE 相关性恢复的特征最高 77% 因果无效

    用消融与转向干预审计稀疏自编码器特征的因果有效性

    发表
    测试
    toy model (32->8, s=0.95, decayed)、toy model (nhidden=20)、GPT-2-small (gpt2-small-res-jb/blocks.8.hook_resid_pre)

    摘要论文揭示 SAE 特征存在几何匹配与因果有效性脱节现象,提出读写解离机制与实践准则。

    深度解读完整解读
  11. 分析与理论arXiv 2607.12649

    研究者提出可提取记忆的匹配比较检验方法

    提出匹配比较校准,界定生成训练序列何时算可抽取记忆

    发表
    测试
    OLMo 2 32B base、OLMo 2 32B Instruct、OLMo 2 7B 等 7 个
    摘要匹配非成员校准阈值后,短序列抽取含大量假阳性,极低概率过阈值也不等于可抽取。

    Cooper 等人从第一性原理重写 extractable memorization:生成训练文本只有在概率高过匹配非训练文本的可预测性基线时,才支持记忆声称。

    深度解读完整解读
  12. 可解释性arXiv 2608.21766

    研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关

    用探针与激活导向分析语言模型的评测意识表征及言语化

    发表
    测试
    Qwen3-8B、Qwen3-32B、Olmo3-7B 等 14 个

    摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。

    深度解读完整解读