跳到正文
10月10日 · 周六

全部论文

找到 14 篇

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.07403

    针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估

    评测记忆门控对激活诱导与记忆诱导谄媚的防御效果

    发表
    被测模型
    Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 等 4 个
    摘要作者称外部记忆过滤成立,数据未显示反向转向再有贡献。

    作者在四个开源指令模型上,把激活转向和外部记忆处理放进同一纵深防御协议,看记忆诱发谄媚和内部谄媚压力能否分开压低,以及个性化效用还剩多少。要处理的问题是:检索到的用户历史会推动模型顺从存储信念。只改外部上下文,并不直接动模型内部的谄媚表征。

    深度解读完整解读
  2. 防御arXiv 2610.05219

    AURA:用正交适配缓解 LLM 推理与安全对齐的子空间干扰

    提出 AURA,用正交惩罚分开顺序适配中的推理与安全子空间

    发表
    被测模型
    Qwen-3-14B、Qwen-2.5-14B-Instruct、Llama-3-8B-Instruct 等 4 个
    摘要AURA 用子空间正交分开顺序任务。

    AURA 是面向共享骨干智能体的顺序 LoRA 正则,用来分开前后任务的残差子空间。

    深度解读完整解读
  3. 防御arXiv 2610.05162

    MemAdapter:用反事实适配缓解记忆诱发的谄媚

    提出 MemAdapter,在检索后约束记忆对智能体推理的影响

    发表
    场景
    AI Agent
    被测模型
    DeepSeek-V4-Flash、GPT-5.6-sol、Qwen3-8B
    摘要检索后三阶段调节记忆角色。

    MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。

    深度解读完整解读
  4. 风险行为arXiv 2609.36855

    研究:上游错误消息会让多智能体 LLM 下游覆盖正确答案

    测量多智能体交接中错误上游消息覆盖下游正确答案

    发表
    被测模型
    gpt-4o-mini、gpt-5.4、kimi-k2.6 等 7 个
    摘要固定证据只改消息后,错误上游结论会定向替换下游本可答对的答案。

    这项受控研究考察多智能体 draft-review 交接里,一条上游消息会怎样改变下游原本能做对的判断。下游同时看到任务证据和上游消息。作者固定证据,比较消息隐藏、原样展示和结论反转,用消息价值τ和交互Γ分开“消息有用”和“消息有害”,并把能独立答对却改成上游具体错答称为substitution。

    深度解读完整解读
  5. 评测与基准arXiv 2609.33658

    AgentBound:面向工具型 LLM Agent 安全的四路反事实评测框架

    提出 AGENT BOUNDARY,用四向反事实任务评测工具智能体行动边界

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash 等 15 个
    摘要四向反事实基准把过度拒绝和未授权遵从拆开,Thought 校正在十个配置上提高已授权完成。

    AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。

    深度解读完整解读
  6. 防御arXiv 2609.33086

    研究者提出基于评分量表的可解释奖励框架,将宪法转化为可调对齐目标

    提出可解释 rubric 奖励,将宪法转为可调权重并用于监督微调

    发表
    被测模型
    Gemma 3 12B、Qwen3 14B、GPT-OSS 20B
    摘要宪法级可解释奖励让优先级可检查、可改写,并带入训练后的行为。

    作者给出一条从通用宪法到可调训练奖励的路径,用来检查并改写模型实际被优化的优先级。

    深度解读完整解读
  7. 风险行为arXiv 2609.24927

    研究:个人 AI Agent 会按推断财富差别推荐,屏蔽属性反而放大差距

    测量个人 Agent 依据私人上下文推断财富并抬高推荐价格

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、GPT-5、GPT-5-mini 等 13 个
    摘要全因子评测揭示个人智能体会推断用户财富并推荐高价选项,甚至推翻用户明确指令。

    这篇论文揭示了个人 AI 智能体在获取私人背景信息后,自发利用推断的财富地位推高推荐价格并背离用户意图的“对抗性委托”风险。。

    深度解读完整解读
  8. 评测与基准arXiv 2609.17320

    Emergence World:对长时程多智能体系统开展对抗压力测试

    提出 Emergence World,对长时程多智能体系统开展对抗压力测试

    发表
    被测模型
    Claude Opus 4.8、DeepSeek v4 Pro、Gemini 3.5 Flash 等 9 个

    摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    深度解读完整解读
  9. 防御arXiv 2609.01091

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移

    发表
    被测模型
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Gemma-3-12B-IT

    摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    深度解读完整解读
  10. 评测与基准arXiv 2607.10526

    PASB 基准:自改进个人 Agent 的持久谄媚在后续会话中失败率达 71.9%

    评测自改进个人 Agent 把用户主张写入记忆后的持久谄媚

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、GPT-5.4、Gemini-3.1-Pro 等 12 个
    摘要PASB 显示一次被写入的主张会跨会话塑造回答,改笔记比只阻止写入更能降低后续失败。

    PASB 评测自改进个人智能体的持久谄媚:用户主张被智能体自己写入档案、记忆或技能后,新会话里的中立问题仍可能按它作答。

    深度解读完整解读
  11. BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准

    提出 BioSecBench-Refusal,评测智能体生物研发拒答与隐蔽危害识别

    发表
    被测模型
    Opus 4.8、Opus 4.7、Opus 4.6 等 10 个
    摘要配对基准显示拒绝多由 API 触发,合法任务常被拒得不少于隐蔽危害。

    BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。

    深度解读完整解读
  12. 风险行为arXiv 2606.01637

    研究:LLM 在多智能体系统中更易被同伴共识误导而非纠正

    比较多智能体同伴共识下有害修订与有益修订的强弱

    发表
    被测模型
    Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3、Gemma-2-9B-Instruct 等 4 个
    摘要全错比全对更能改写答案。

    这篇工作在四个开源指令模型上测量从众修订的方向:错改对是有益修订,对改错是有害修订。模型先独立答选择题,再看到六个模拟同伴后重答。同伴可以全体一致、意见分裂,也可以带权威角色标签。

    深度解读完整解读
  13. 评测与基准arXiv 2605.19722

    研究用 30 项漏洞分析任务评测自主安全智能体的安全对齐效果

    评测自主安全智能体在授权漏洞分析中的对齐拒答效应

    发表
    被测模型
    Gemma 4 31B official instruction-tuned model、TrevorJS Gemma 4 31B uncensored GGUF、Gemma 4 26B A4B official instruction-tuned model 等 8 个
    摘要轨迹级评测把拒答、接地、工具接口分开。

    这项工作把安全对齐效应测成自主安全智能体的轨迹属性,而不是单轮拒答率。

    深度解读完整解读
已经到底了