跳到正文
10月10日 · 周六

全部论文

找到 2 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2604.00012

    研究提出 SafeReAct:恢复后训练大模型被掩盖的安全机制

    提出 SafeReAct,用 LoRA 重激活后训练模型被掩盖的安全机制

    发表
    被测模型
    DeepSeek-R1-distilled LLaMA-8B、DeepSeek-R1-distilled Qwen-7B、DeepSeek-R1-distilled Qwen-14B 等 9 个
    摘要SafeReAct 用剪枝得到的安全表示做 LoRA 对齐,以恢复后训练模型被掩盖的拒绝行为。

    这篇工作针对后训练 LLM 的安全下降,提出表示对齐方法SafeReAct。

    深度解读完整解读
  2. 可解释性arXiv 2602.04856

    研究揭示推理模型拒答假新闻请求时思维链仍含不安全叙事

    分析推理模型拒答假新闻时思维链的内部安全分叉

    发表
    被测模型
    Llama3-8B、Qwen3-4B、Qwen3-8B 等 5 个
    摘要拒绝不等于过程安全。

    作者对推理 LLM 在虚假新闻生成中的 CoT 做内部路由分析,并只改关键头来降低过程风险。作者称这是该场景下不安全 CoT 的首次系统分析。

    深度解读完整解读
已经到底了