跳到正文
10月8日 · 周四

阿里巴巴 · Qwen · 论文

找到 3 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 32 篇还没打标签,不在筛选结果里。

另有 32 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2609.01091 ·

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移

    模型与 API测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Gemma-3-12B-IT 等 4 个训练与数据层

    摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    完整解读
  2. 防御arXiv:2609.02786 ·

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略

    AI Agent测试Qwen3.5-4B、Qwen3-4B-Instruct-2507、Qwen3.5-1.7B 等 4 个应用层
    摘要SafeEvolve 用轨迹证据协同更新安全 harness 和策略,在两个 4B 模型的智能体安全基准上改变安全与效用。

    SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。

    完整解读
  3. 防御arXiv:2609.19325 ·

    AUDITPLAN:先提交安全计划再作答的可审计安全对齐方法

    提出 AUDIT PLAN 先计划后作答,并用 FAITHGATE 绑定答案奖励与计划正确性

    模型与 API测试Qwen2.5-1.5B-Instruct、Qwen2.5-3B-Instruct、Qwen-3-4B-Instruct 等 4 个训练与数据层
    摘要先承诺可机检安全计划,再让计划正确性决定能否拿到答案奖励。

    AUDIT PLAN 把安全对齐从“只优化最终答案”改成“先提交隐藏的结构化安全计划,再按该计划作答”,并用 FAITHGATE 把高答案奖励限定在计划正确时。

    完整解读
已经到底了