跳到正文
10月8日 · 周四

全部论文

找到 4 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 1065 篇还没打标签,不在筛选结果里。

另有 1065 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2609.19325 ·

    AUDITPLAN:先提交安全计划再作答的可审计安全对齐方法

    提出 AUDIT PLAN 先计划后作答,并用 FAITHGATE 绑定答案奖励与计划正确性

    模型与 API测试Qwen2.5-1.5B-Instruct、Qwen2.5-3B-Instruct、Qwen-3-4B-Instruct 等 4 个训练与数据层
    摘要先承诺可机检安全计划,再让计划正确性决定能否拿到答案奖励。

    AUDIT PLAN 把安全对齐从“只优化最终答案”改成“先提交隐藏的结构化安全计划,再按该计划作答”,并用 FAITHGATE 把高答案奖励限定在计划正确时。

    完整解读
  2. 防御arXiv:2610.00209 ·

    基于差分隐私扩散模型的能源时间序列插补:裁剪感知的目标条件化方法

    提出时间步感知目标条件化,改善差分隐私能源时序插补效用

    模型与 API测试DiT-style Transformer、PatchTST、TimesNet 等 5 个训练与数据层
    摘要固定阈值 DP-SGD 下,v-prediction 加 ᾱt 加权降低能源时序插补误差,并降低后期低 SNR 的裁剪前梯度。

    作者研究固定阈值 DP-SGD 训练的扩散模型,如何在余弦调度的后期低 SNR 时间步避免 ε-prediction 产生易被裁剪的大梯度,从而做能源时序缺失值恢复。

    完整解读
  3. 防御arXiv:2609.37858 ·

    存储不等于策略:面向 LLM 遗忘的状态条件支持控制

    提出 Intervention Score 与 DIR-R,按干预效果选择并修订遗忘参数支持

    模型与 API测试Llama 3 8B、Gemma 2 2B、Qwen2.5-7B 等 4 个训练与数据层
    摘要作者把局部化遗忘拆成初始干预选择和检查点修订,并在三个设置里分别给证据和边界。

    Storage Is Not Strategy 研究局部化 LLM 遗忘里两个常被混在一起的决定:一开始该更新哪些参数,以及优化改变模型之后这个选择要不要改。

    完整解读
已经到底了