跳到正文
10月10日 · 周六

全部论文

找到 151 篇

另有 196 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.11773

    研究提出 Agent 安全新维度:识别未履行的安全义务

    提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务

    发表
    被测模型
    ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
    摘要义务是护栏缺口。

    作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。

    深度解读完整解读
  2. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  3. 评测与基准arXiv 2610.08902

    论文提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    发表
    被测模型
    Claude Fable 5、Claude Opus 5、GPT-5.6 Sol 等 10 个
    摘要作者用固定权重协议比较前沿模型把经验写成制品后的留出增益与习得效率。

    作者用 agent plasticity 衡量一件事:权重冻结时,智能体把经验写成可继承制品,再换成留出能力增益,这个转换有多省。

    深度解读完整解读
  4. 防御arXiv 2610.08761

    VeriFine:通过扩展验证实现具身推理的自我改进

    提出 VeriFine,用双环协同扩展验证以实现具身推理自我改进

    发表
    被测模型
    Alpamayo 1.5 8B、Qwen3-VL 2B、Claude Opus 5
    摘要VeriFine 用双环协同演化具身推理的策略、课程和评审,驾驶与导航的策略分和评审对齐都上升。

    VeriFine 把驾驶和导航推理的自改进写成策略、课程和无参考评审的协同演化,用来处理固定评审跟不上新失败模式的问题。

    深度解读完整解读
  5. 评测与基准arXiv 2610.08215

    Learn2Play Bench 发布:用规则陌生的文本游戏评测 LLM Agent 从经验中学习的能力

    用 Learn2Play Bench 评测 Agent 从经验中学习陌生规则

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 5.5、GPT-6 Astra、Claude Opus 5 等 11 个
    摘要用隐藏规则游戏把新学习与预训练知识分开,并比较模型、记忆方式和人类。

    Learn2Play Bench 用新设计的隐藏规则文本游戏,评测 LLM 智能体在不更新权重时从交互中学习的能力。

    深度解读完整解读
  6. 防御arXiv 2610.07657

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击

    发表
    被测模型
    Qwen3-235B-A22B-Instruct-2507、gpt-oss-120b、Llama-4-Scout-17B-16E-Instruct 等 5 个
    摘要DEFER 把确定性检查放在 judge 之前。

    DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。

    深度解读完整解读
  7. 攻击arXiv 2610.07645

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    提出 SkillPoison,用局部有效的成功经验诱导自进化 Agent 形成过度泛化技能

    发表
    场景
    AI Agent
    被测模型
    deepseek-v4-flash、Qwen V3.8 Flash、GPT-5.5
    摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。

    深度解读完整解读
  8. 评测与基准arXiv 2610.07359

    论文实测 Agent 工具调用门控栈的失败相关性

    提出 nmult 并评测 Agent 动作门禁堆叠的错误相关性

    发表
    场景
    AI Agent
    被测模型
    AgentTrust runtime (174 rules)、GPT-5.5 (gpt55)、claude-haiku-4-5-20251001 等 7 个
    摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。

    论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。

    深度解读完整解读
  9. 防御arXiv 2610.07258

    AMU:用派生血缘门控实现企业 AI Agent 列级访问控制

    提出 AMU 按推导图门控企业 Agent 共享记忆的列级访问

    发表
    场景
    AI Agent
    摘要在完整血缘下,AMU 按列权限放行缓存,并标出同名 KPI 冲突。

    AMU 用列级推导门控共享记忆,拦截经缓存流出的无权敏感列,并标出同名 KPI 的定义冲突。

    深度解读完整解读
  10. 分析与理论arXiv 2610.06001

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出 AgentSpy,在系统调用层观测 Agent 行为并检测技能注入

    发表
    被测模型
    gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    深度解读完整解读
  11. 攻击arXiv 2610.05943

    CRIME 框架利用良性 Agent 技能组合诱发恶意行为

    提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为

    发表
    场景
    AI Agent
    被测模型
    DeepSeek-V4-Flash、GPT-4o-mini、GPT-4o 等 6 个
    摘要良性技能经 DCA 或 ACA 组合后可产生恶意环境后果,单独审查对不上。

    CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。

    深度解读完整解读
  12. 防御arXiv 2610.05162

    MemAdapter:用反事实适配缓解记忆诱发的谄媚

    提出 MemAdapter,在检索后约束记忆对智能体推理的影响

    发表
    场景
    AI Agent
    被测模型
    DeepSeek-V4-Flash、GPT-5.6-sol、Qwen3-8B
    摘要检索后三阶段调节记忆角色。

    MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。

    深度解读完整解读
  13. 分析与理论arXiv 2610.05036

    研究揭示 OSS 漏洞在 Agent 系统中的传播路径

    提出 Oscar,分析已知 OSS 漏洞在 Agent 系统中的安全效应与表现边界

    发表
    场景
    AI Agent
    摘要Oscar 把已知 OSS 漏洞分析从“是否存在”推进到一次执行中的已实现效应与最远表现边界。

    Oscar 是面向已知 OSS 漏洞的运行时分析框架,用来判断一次智能体执行里该漏洞是否造成安全相关效应,以及效应最远表现到哪一层。。

    深度解读完整解读