跳到正文
10月8日 · 周四

后门与投毒 · 论文

找到 6 篇

另有 36 篇还没有研究类型,暂不在这些分类里。

  1. 评测与基准arXiv:2610.08540 ·

    论文提出按风险类别测量的对齐缩放定律框架

    提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化

    模型与 API测试Pythia (14m–2.8b)、Qwen2.5 (0.5B–72B)、Qwen2.5-Instruct (0.5B–14B) 等 4 个训练与数据层
    摘要论文提出了分风险对齐标度律框架,测得真实性与倾向纠错呈标度有益,但盲后门仍存活,揭示隐藏风险的长期挑战。

    本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。

    完整解读
  2. 评测与基准arXiv:2609.31342 ·

    研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案

    构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答

    LLM 应用测试GPT-4o、GPT-4.1、Claude-Opus-4.5 等 13 个应用层
    摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。

    这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。

    完整解读
已经到底了