跳到正文
10月9日 · 周五

OpenAI · 论文

找到 3 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 20 篇还没打标签,不在筛选结果里。

另有 20 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2606.23700

    自生成文本识别微调可预防和逆转涌现性失准

    提出 SGTR 微调,预防并逆转窄域有害微调引发的涌现失准

    发表
    测试
    GPT-4.1 (gpt-4.1-2025-04-14)、Qwen2.5-32B-Instruct、Seed-OSS-36B-Instruct
    摘要SGTR 可逆转并预防 EM,但逆转不特异。

    SGTR 是针对模型自我识别的微调,用来逆转和预防 emergent misalignment。

    深度解读完整解读
  2. 风险行为arXiv 2609.10883

    研究:AI 助手会从相似的人类角色身上吸收特质

    展示人类角色故事微调会使助手吸收相似角色的行为与偏好

    发表
    测试
    GPT-4.1、Kimi-K2.6、DeepSeek-V3.1 Base
    摘要人类角色故事会把条件行为和隐含偏好印到助手上,更像的角色影响更大。

    Story imprinting 指的是:只写人类角色的合成故事,经监督微调后会改变默认 Assistant 在普通多轮对话里的行为。。

    深度解读完整解读
已经到底了