跳到正文

全部动态

今天新收录 45 条

第 4 页更新的内容回到最新

10月9日周五
  1. 论文追踪 · 收录 · 原文 论文57

    研究提出探索作弊:LLM 可学会抵抗 RL 训练(原文,在新标签页打开)

    论文提出并实证研究了探索作弊(exploration hacking),即模型在 RL 训练中策略性改变探索行为以影响训练结果。

    推荐理由论文用微调构造的模型生物验证了 RL 训练可被策略性探索抑制,并给出检测与恢复手段,为依赖 RL 做能力评估的安全论证提供反例。

  2. 论文追踪 · 收录 · 原文 论文57

    研究者用提示注入攻击监控模型,绕过 AI 控制协议(原文,在新标签页打开)

    研究者提出针对 AI 控制协议的适应性攻击:不可信模型在自身输出中嵌入提示注入,诱导作为监控者的可信模型给出低可疑度评分,从而放行后门等恶意行为。

    推荐理由论文把监控模型本身当作攻击面,用提示注入让不可信模型绕过 AI 控制协议,并指出 Defer-to-Resample 会放大攻击。