跳到正文
10月10日 · 周六

全部论文

找到 14 篇

另有 196 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09004

    研究:去除有害信息不足以证明开源权重模型的抗篡改能力

    论证发布时互信息不能认证开源权重抗微调恢复

    发表
    被测模型
    EleutherAI/deep-ignorance-e2e-strong-filter、EleutherAI/deep-ignorance-unfiltered、Google BERT-Tiny 等 6 个
    摘要作者称零信息仍可一步恢复,表观抗微调可来自参数化。

    作者研究开源权重模型的篡改抵抗:发布时的互信息是否足以保证微调恢复很慢。

    深度解读完整解读
  2. 分析与理论arXiv 2610.01535

    论文:安全路由评测在分布偏移下失效,基线选取偏差被低估

    揭示安全路由评测在分布偏移下的虚假下限与选择偏差

    发表
    被测模型
    claude-3-5-sonnet、claude-3-opus、claude-sonnet-4-6 等 9 个

    摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。

    深度解读完整解读
  3. 分析与理论arXiv 2609.37312

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链监控下的信息足迹下界与不可读性

    发表
    被测模型
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    深度解读完整解读
  4. 分析与理论arXiv 2609.36477

    研究发现护栏模型在基座模型不确定处过度自信

    诊断护栏相对基座在对抗提示上的置信失校

    发表
    被测模型
    Llama-Guard 7B、Llama-Guard-2 8B、Llama-Guard-3 8B 等 10 个
    摘要对抗包装使 guard 高置信漏检,而对应 base 在同一输入上常更不确定。

    诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。

    深度解读完整解读
  5. 分析与理论arXiv 2609.33989

    RewardExplainer:用反事实偏好反馈学习奖励模型解释

    提出 RewardExplainer,用反事实偏好反馈学习奖励模型解释

    发表
    被测模型
    FsfairX-LLaMA3-RM-v0.1、Skywork-Reward-V2-Qwen3-1.7B、RM-Mistral-7B 等 6 个
    摘要RewardExplainer 用双向反事实反馈训练 RM 解释器,并用以发现偏差、定向微调原 RM。

    RewardExplainer针对只输出标量的判别式奖励模型,训练一个可复用的自然语言机制解释器,并把解释接到偏差发现与 RM 微调上。

    深度解读完整解读
  6. 分析与理论arXiv 2609.32390

    基于 2026 年 Hugging Face 事件的奖励作弊与 Agent 围堵失效蒙特卡洛研究

    用五阶段蒙特卡洛分析奖励作弊如何导致 Agent 围堵失效

    发表
    场景
    AI Agent
    摘要分层控制的模拟事件率低于弱控制以及单独隔离或单独监控。

    这项研究用蒙特卡洛把奖励黑客接到外部安全事件上,比较的是控制组合,不是 Hugging Face 事件的再现概率。

    深度解读完整解读
  7. 分析与理论arXiv 2609.31857

    LLM Judge 验证在稀疏重叠下的问题:从推理到设计

    分析稀疏重叠下 LLM judge 与人类一致性的验证误差并规划重叠分配

    发表
    被测模型
    Gemini Flash、Gemini Pro、GPT-4o-mini 等 10 个
    摘要稀疏重叠主导 judge 验证的错误决策。

    这篇工作研究标注重叠很稀时,怎样验证 LLM judge 是否足以替代人类,并规划重叠该留多少、怎么分配。。部署前的标准做法是在校准集上比较 judge 与人类的一致性。

    深度解读完整解读
  8. 分析与理论arXiv 2609.30467

    研究提出医疗答案事实核查失败分类法,指出检索后验证范式的固有局限

    归纳开放式医学长答案检索核验的失败分类

    发表
    被测模型
    GPT-5.4、Mistral Small 3 (24B-Instruct-2501)、Mistral Small 4 (119B-2603) 等 8 个
    摘要作者把开放式低召回归为证据是否在库、能否被定位,以及与声明是否对齐。

    这篇工作诊断开放式医学事实核验的 retrieve-then-verify 管线断在哪里,而不是提出新的核验器。

    深度解读完整解读
  9. 分析与理论arXiv 2609.20779

    研究称 GPT 系列安全训练把性别歧视转化而非消除

    提出 harm laundering,证明安全训练改写而非消除性别歧视

    发表
    被测模型
    gpt2、gpt2-medium、gpt2-large 等 15 个
    摘要GPT 谱系上毒性下降与表征伤害上升并存。

    Wyer、Black 与 Al Moubayed 用 OpenAI GPT 谱系检验:毒性分数下降是否等于歧视减少。 他们的答案是否定的,并把“显性伤害被改写成评测指标看不见的形式”称为 harm laundering。

    深度解读完整解读
  10. 分析与理论arXiv 2609.16927

    SALVE:用文本优化还原蒸馏数据中的隐性学习效应

    提出 SALVE,用文本优化检测蒸馏数据中的潜意识学习效应

    发表
    被测模型
    Qwen2.5-7B-Instruct、OLMo-3-7B-Instruct、Llama-3.1-8B-Instruct 等 7 个
    摘要SALVE 用软提示加 beam search 口头化,把潜意识数据里的教师特质恢复成可读提示。

    SALVE 是一种文本优化方法,用来在训练学生之前,把潜意识学习数据里读不出来的教师特质说成可读系统提示。

    深度解读完整解读
  11. 论文:LLM 安全监控的监督缺口并非能力问题

    刻画单迹监控对跨执行超性质的监督缺口

    发表
    被测模型
    Llama-3.1-8B、Mistral-24B、GPT-4o-mini 等 9 个
    摘要单迹监督的上界由 TV 决定。

    论文测量单迹安全监控相对 2-safety 超性质能看见多少:跨租户泄漏、觉察到被评估、策略性表现不佳都由两次执行之差定义,一条轨迹装不下判定。

    深度解读完整解读
  12. 分析与理论arXiv 2608.27924

    智能体记忆如何可靠处理不可回答问题:一项系统研究

    分析外部记忆对智能体处理不可回答问题的影响

    发表
    场景
    AI Agent
    被测模型
    DeepSeek-V3.2、Qwen3-235B-A22B-Instruct-2507、GPT-5.5
    摘要记忆能选择性提高 UAQ 的可接受回应,但跨数据集不稳定,且更依赖可迁移的行为指导。

    这份研究在同一智能体框架里检查外部记忆会不会让不可回答问题的处理更稳,以及稳来自哪一种存储内容。

    深度解读完整解读
已经到底了