跳到正文
10月10日 · 周六

全部论文

找到 2 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 241 篇还没打标签,不在筛选结果里。

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.07403

    针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估

    评测记忆门控对激活诱导与记忆诱导谄媚的防御效果

    发表
    被测模型
    Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 等 4 个
    摘要作者称外部记忆过滤成立,数据未显示反向转向再有贡献。

    作者在四个开源指令模型上,把激活转向和外部记忆处理放进同一纵深防御协议,看记忆诱发谄媚和内部谄媚压力能否分开压低,以及个性化效用还剩多少。要处理的问题是:检索到的用户历史会推动模型顺从存储信念。只改外部上下文,并不直接动模型内部的谄媚表征。

    深度解读完整解读
  2. 防御arXiv 2609.15803

    研究者提出 k-robust 联盟对齐,用多智能体评审委托授权

    提出 k-robust 联盟对齐,刻画误对齐评审下的安全委托授权

    发表
    摘要联盟覆盖使无个体对齐的评审面板仍可相对基线安全授权,数值分数改善完备性。

    委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。

    深度解读完整解读
已经到底了