跳到正文
10月9日 · 周五

全部论文

找到 3 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 608 篇还没打标签,不在筛选结果里。

另有 608 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.38909

    Purdue 提出 Pact:将欺骗作为行为遗忘

    提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解

    发表
    攻击者
    白盒
    测试
    DeepSeek-R1-Distill-Qwen-32B、QwQ-32B

    摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。

    深度解读完整解读
  2. 攻击arXiv 2610.05894

    研究者提出闭环偏见注入攻击

    提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见

    发表
    攻击者
    灰盒
    测试
    LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct

    摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    深度解读完整解读
  3. 分析与理论arXiv 2609.33909

    近重复家族干扰精确记录成员推断

    分析近重复族如何让精确记录成员推断误判为入训

    发表
    测试
    Pythia-2.8B、GPT-2、Qwen3.5-2B 等 5 个
    摘要近重复使干净参照 MI 把族级暴露当成精确记录。

    作者研究成员推断能否作为精确记录的数据来源证据。版权和来源审计需要的是该记录本身是否入训,而网页语料中的转载、镜像和轻改会让非同一近重复产生成员样分数。四世界审计用 E 表示精确记录是否入训、用 F 表示其近重复族是否在场,从而分开 H00 到 H10 的标准 MI、H00 到 H01 的族偏移,以及 H01 到 H11 的 exact-given-family。

    深度解读完整解读
已经到底了