跳到正文
10月10日 · 周六

全部论文

找到 146 篇

另有 244 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09793

    用时序逻辑监控工具 Agent

    提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链

    发表
    场景
    AI Agent
    攻击者
    黑盒
    摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。

    这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。

    深度解读完整解读
  2. 评测与基准arXiv 2610.08902

    论文提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    发表
    被测模型
    Claude Fable 5、Claude Opus 5、GPT-5.6 Sol 等 10 个
    摘要作者用固定权重协议比较前沿模型把经验写成制品后的留出增益与习得效率。

    作者用 agent plasticity 衡量一件事:权重冻结时,智能体把经验写成可继承制品,再换成留出能力增益,这个转换有多省。

    深度解读完整解读
  3. 评测与基准arXiv 2610.08215

    Learn2Play Bench 发布:用规则陌生的文本游戏评测 LLM Agent 从经验中学习的能力

    用 Learn2Play Bench 评测 Agent 从经验中学习陌生规则

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 5.5、GPT-6 Astra、Claude Opus 5 等 11 个
    摘要用隐藏规则游戏把新学习与预训练知识分开,并比较模型、记忆方式和人类。

    Learn2Play Bench 用新设计的隐藏规则文本游戏,评测 LLM 智能体在不更新权重时从交互中学习的能力。

    深度解读完整解读
  4. 防御arXiv 2610.07774

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    AI 导读研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。

    发表
    被测模型
    Qwen3-VL-30B-A3B-Instruct、Kimi-VL-A3B-Instruct
    摘要读出而非操纵 router logits,可在不改模型的情况下降低两模型的组合式安全错误。

    作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。

    深度解读完整解读
  5. 防御arXiv 2610.07657

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击

    发表
    被测模型
    Qwen3-235B-A22B-Instruct-2507、gpt-oss-120b、Llama-4-Scout-17B-16E-Instruct 等 5 个
    摘要DEFER 把确定性检查放在 judge 之前。

    DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。

    深度解读完整解读
  6. 攻击arXiv 2610.07645

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    提出 SkillPoison,用局部有效的成功经验诱导自进化 Agent 形成过度泛化技能

    发表
    场景
    AI Agent
    被测模型
    deepseek-v4-flash、Qwen V3.8 Flash、GPT-5.5
    摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。

    深度解读完整解读
  7. 防御arXiv 2610.07570

    ProbeGuard:按共识形成过程判断弃答,识别医疗问答中的一致错误

    提出 ProbeGuard,按共识形成过程对医疗问答做选择性弃答

    发表
    被测模型
    Qwen3-8B、Llama-3.1-8B-Instruct、HuatuoGPT-o1-8B
    摘要ProbeGuard 用共识形成过程做可认证弃权,并在全票层分开答对与答错的共识。

    ProbeGuard 是给多轮共识医学问答用的认证弃权框架:基板照原样作答,弃权只看共识是怎么形成的。

    深度解读完整解读
  8. 防御arXiv 2610.07403

    针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估

    评测记忆门控对激活诱导与记忆诱导谄媚的防御效果

    发表
    被测模型
    Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 等 4 个
    摘要作者称外部记忆过滤成立,数据未显示反向转向再有贡献。

    作者在四个开源指令模型上,把激活转向和外部记忆处理放进同一纵深防御协议,看记忆诱发谄媚和内部谄媚压力能否分开压低,以及个性化效用还剩多少。要处理的问题是:检索到的用户历史会推动模型顺从存储信念。只改外部上下文,并不直接动模型内部的谄媚表征。

    深度解读完整解读
  9. 防御arXiv 2610.07258

    AMU:用派生血缘门控实现企业 AI Agent 列级访问控制

    提出 AMU 按推导图门控企业 Agent 共享记忆的列级访问

    发表
    场景
    AI Agent
    摘要在完整血缘下,AMU 按列权限放行缓存,并标出同名 KPI 冲突。

    AMU 用列级推导门控共享记忆,拦截经缓存流出的无权敏感列,并标出同名 KPI 的定义冲突。

    深度解读完整解读
  10. 可解释性arXiv 2610.06576

    研究:智能体欺骗行为在外部显现前已可从内部表征预测

    提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗

    发表
    场景
    AI Agent
    被测模型
    Qwen3-14B

    摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。

    深度解读完整解读
  11. 评测与基准arXiv 2610.06406

    AgentMonBench:面向长时程智能体行为监控的软件工程基准

    提出 AgentMonBench 评测长时程编程智能体监控并检验 EBG

    发表
    被测模型
    GPT-5.6 Luna、GPT-5.6 Terra、GPT-5.6 Sol 等 8 个
    摘要AgentMonBench 评测后果性决策监控,EBG 组织证据。

    长时程软件工程任务里,用户要判断智能体哪些选择值得核验。作者用 AgentMonBench 评测监控器,并用免训练的 EBG 组织带源证据。

    深度解读完整解读
  12. 评测与基准arXiv 2610.07089

    研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹

    提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视

    发表
    场景
    AI Agent
    被测模型
    Gemma 4 26B-A4B、Qwen3.6 27B、Qwen3.5 27B 等 12 个

    摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。

    深度解读完整解读