跳到正文
10月8日 · 周四

全部论文

找到 6 篇

另有 717 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.09600

    SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

    提出安全电路对齐,把对齐更新限制在预训练拒绝电路内

    发表
    测试
    Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个

    摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。

    深度解读完整解读
  2. 分析与理论arXiv 2609.37914

    研究用训练数据归因量化微调数据对涌现性失准的影响

    用训练数据归因估计错误建议样本对涌现失准的贡献

    发表
    测试
    OLMo 3 7B-SFT、Qwen 2.5 1.5B、Qwen 2.5 3B 等 12 个
    摘要错误建议对涌现失调的贡献不均匀,归因过滤可增减失调,且最有效的是模型自己的分数。

    EleutherAI 用训练数据归因考察错误建议微调中,哪些样本推动涌现失调。。窄域有害数据上的微调会使模型在无关问题上也给出有害回答。

    深度解读完整解读
  3. 分析与理论arXiv 2609.32116

    研究提出 Best-of-N 越狱的物理势垒模型,挑战攻击成功率幂律规律

    用物理陷阱模型描述 Best-of-N 越狱的攻击面规律

    发表
    测试
    Qwen2.5-7B (base)、Llama-3.1-8B-Instruct、Qwen2.5-3B-Instruct 等 5 个
    摘要四参数势垒模型拟合 BoN 的两预算面,并把指数交叉归因于数据集有限。

    Biroli 用一个玻璃陷阱式的微观模型,把 Best-of-N 越狱写成熵瓶颈加能量鞍点,并用四个数描述 (N, M) 攻击面及温度依赖。。

    深度解读完整解读
已经到底了