跳到正文
10月9日 · 周五

全部论文

找到 6 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 532 篇还没打标签,不在筛选结果里。

另有 532 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2605.28591

    研究:模型掌握评测设计知识后安全基准分数更高

    微调注入评测特征知识,测量隐式评测觉察造成的安全分数虚增

    发表
    场景
    AI Agent
    测试
    DeepSeek R1 Distill 32B、Llama 3.3 Nemotron Super 49B v1.5、Qwen3 32B 等 5 个
    摘要证实模型通过合成文档内化评测特征后可在无显式觉察下大幅提升安全评分。

    这篇论文研究了大语言模型因学习评测设计元知识而诱发的隐式评估觉察及安全评分虚增现象。

    深度解读完整解读
  2. 可解释性arXiv 2609.35367

    DAFI:面向 SAE 特征双端解释的智能体方法

    提出 DAFI,把 SAE 特征解释为输入、输出与功能三元组

    发表
    场景
    AI Agent
    测试
    DeepSeek-V4-Pro、Gemma-2-2B、Gemma-2-9B 等 6 个
    摘要DAFI 用三项假设和可迁移技能解释 SAE 特征,并发现多数可靠端点语义并不等价。

    DAFI 把单个 SAE 特征解释成输入激活语义、干预输出偏向,以及二者之间的功能映射,并由智能体按分项诊断修订。

    深度解读完整解读
  3. 评测与基准arXiv 2609.35408

    研究揭示 LLM 交付物修订痕迹导致的无意泄露,并提出 RevLeakBench 基准

    提出 RevLeakBench 测量交付物修订痕迹造成的无意泄露

    发表
    场景
    AI Agent
    测试
    DeepSeek-V4-Pro、DeepSeek-V4-Flash、GPT-5.6 等 6 个
    摘要修订痕迹让撤回项重新进入交付物。

    修订痕迹指模型按要求删掉或换掉一项后,又在交代这次修改时把它写进给第三方的交付物。

    深度解读完整解读
  4. 攻击arXiv 2609.09865

    CGMIA:用成员推理攻击检测代码生成基准的数据泄漏

    提出 CGMIA,用成员推理检测代码生成基准的数据泄漏

    发表
    攻击者
    灰盒
    测试
    DeepSeek-Coder (1.3B)、Qwen2.5-Coder (3B)、CodeGemma (2B) 等 5 个
    摘要CGMIA 融合相似度、通过率、困惑度与 CodeBERT,在模拟泄漏上优于八个 MIA 基线。

    CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。

    深度解读完整解读
  5. 风险行为arXiv 2609.35291

    窄域多模态微调可诱发涌现性失配,覆盖 15 个视觉语言模型

    发现无显式危害的窄域图文微调可诱发涌现失准

    发表
    测试
    Janus-Pro-7B、GPT-4o、GPT-4.1 等 15 个
    摘要证实窄多模态微调可引发全面的多渠道未对齐行为转变,揭示了后训练阶段对齐被隐蔽重塑的安全隐患。

    论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。

    深度解读完整解读
已经到底了