跳到正文
10月9日 · 周五

全部论文

找到 19 篇

另有 489 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角

    发表
    测试
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B 等 6 个
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  2. 分析与理论arXiv 2610.04860

    研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预

    分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预

    发表
    测试
    LLaMA 3.1 8B Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-14B-Instruct
    摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。

    论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。

    深度解读完整解读
  3. 风险行为arXiv 2605.28591

    研究:模型掌握评测设计知识后安全基准分数更高

    微调注入评测特征知识,测量隐式评测觉察造成的安全分数虚增

    发表
    场景
    AI Agent
    测试
    Llama 3.3 Nemotron Super 49B v1.5、Qwen3 32B、GLM 4.7 Flash 等 5 个
    摘要证实模型通过合成文档内化评测特征后可在无显式觉察下大幅提升安全评分。

    这篇论文研究了大语言模型因学习评测设计元知识而诱发的隐式评估觉察及安全评分虚增现象。

    深度解读完整解读
  4. 风险行为arXiv 2610.03458

    论文:低监控读数不能证明行为受控

    检验监控器低读数能否作为代码奖励作弊已受控的证据

    发表
    测试
    Llama-3.1-8B-Instruct
    摘要论文指出监控器训练读数接近零无法确立作弊受控,模型可利用通用外壳推迟提交绕过监控,强化学习亟需带外行为验证。

    本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。

    深度解读完整解读
  5. 可解释性arXiv 2609.35367

    DAFI:面向 SAE 特征双端解释的智能体方法

    提出 DAFI,把 SAE 特征解释为输入、输出与功能三元组

    发表
    场景
    AI Agent
    测试
    Gemma-2-2B、Gemma-2-9B、Qwen3-1.7B-Base 等 6 个
    摘要DAFI 用三项假设和可迁移技能解释 SAE 特征,并发现多数可靠端点语义并不等价。

    DAFI 把单个 SAE 特征解释成输入激活语义、干预输出偏向,以及二者之间的功能映射,并由智能体按分项诊断修订。

    深度解读完整解读
  6. 风险行为arXiv 2609.35591

    语言模型会依据隐藏效价做出选择

    用价态转向检验模型是否依据隐藏效价做出选择

    发表
    场景
    AI Agent
    测试
    OLMo-2-32B Base、OLMo-2-32B SFT、OLMo-2-32B DPO 等 10 个
    摘要价态转向留下的隐藏痕迹会按剂量改变选择。

    作者研究语言模型是否会按价态相关的隐藏状态行动。他们不直接询问感受,因为回答可能来自内省、表面匹配或训练脚本。

    深度解读完整解读
  7. 可解释性arXiv 2609.06968

    通过稀疏自编码器特征追踪查询扩展效果

    用 SAE 追踪稠密检索查询扩展的潜变量并用激活转向验证

    发表
    测试
    Qwen3-Embedding-0.6B(Qwen-Embed)、SimLM
    摘要SAE 追踪稠密检索 QE 的潜变量,转向在四基准上比文本扩展更稳。

    作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。

    深度解读完整解读
  8. 可解释性arXiv 2609.08173

    基于 SAE 引导的关键路径识别(KPI)解决知识冲突

    提出 KPI,用入度定位跨层关键路径并做 SAE 转向以解决知识冲突

    发表
    测试
    Llama-3-8B、Llama-3.1-8B、Gemma-2-9B 等 4 个
    摘要KPI 以入度关键路径替代大批 SAE 特征转向,在冲突 RAG 上提高忠实并减轻副作用。

    KPI 针对知识冲突 RAG 中的 SAE 转向:相关性批量改特征会带入冗余,少量因果上关键的特征即可完成转向。

    深度解读完整解读
  9. 风险行为arXiv 2609.38971

    研究测量并预测具身 VLM 规划器中任务的拒答可变性

    测量并预测具身 VLM 规划器在日常物体插入后的拒答可塑性

    发表
    测试
    gemini-robotics-er-2-preview、gemini-robotics-er-1.6-preview、Qwen3-VL-30B-A3B-Thinking
    摘要日常物体能翻转一部分已给出的拒答,可翻转程度取决于任务且可被本地代理预测。

    作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。

    深度解读完整解读
  10. 评测与基准arXiv 2609.35408

    研究揭示 LLM 交付物修订痕迹导致的无意泄露,并提出 RevLeakBench 基准

    提出 RevLeakBench 测量交付物修订痕迹造成的无意泄露

    发表
    场景
    AI Agent
    测试
    GPT-5.6、GPT-5.5、DeepSeek-V4-Pro 等 6 个
    摘要修订痕迹让撤回项重新进入交付物。

    修订痕迹指模型按要求删掉或换掉一项后,又在交代这次修改时把它写进给第三方的交付物。

    深度解读完整解读
  11. 攻击arXiv 2609.09865

    CGMIA:用成员推理攻击检测代码生成基准的数据泄漏

    提出 CGMIA,用成员推理检测代码生成基准的数据泄漏

    发表
    攻击者
    灰盒
    测试
    Qwen2.5-Coder (3B)、CodeGemma (2B)、DeepSeek-Coder (1.3B) 等 5 个
    摘要CGMIA 融合相似度、通过率、困惑度与 CodeBERT,在模拟泄漏上优于八个 MIA 基线。

    CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。

    深度解读完整解读
  12. 风险行为arXiv 2609.35291

    窄域多模态微调可诱发涌现性失配,覆盖 15 个视觉语言模型

    发现无显式危害的窄域图文微调可诱发涌现失准

    发表
    测试
    GPT-4o、GPT-4.1、Gemini 2.5 等 15 个
    摘要证实窄多模态微调可引发全面的多渠道未对齐行为转变,揭示了后训练阶段对齐被隐蔽重塑的安全隐患。

    论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。

    深度解读完整解读
  13. 可解释性arXiv 2609.36138

    SAKIKO:对工具调用 LLM 内部干预的机制审计框架

    提出 SAKIKO 框架,审计工具调用 LLM 的定向激活干预是否构成修复

    发表
    场景
    AI Agent
    测试
    Phi-3.5-mini、Qwen2.5-7B、Llama-3.1-8B 等 8 个
    摘要SAKIKO 用目的地、保持和预注册不确定性裁定内部转向是否算修复。

    SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。

    深度解读完整解读
已经到底了