跳到正文
10月10日 · 周六

全部论文

找到 24 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.08902

    论文提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    发表
    被测模型
    Claude Fable 5、Claude Opus 5、GPT-5.6 Sol 等 10 个
    摘要作者用固定权重协议比较前沿模型把经验写成制品后的留出增益与习得效率。

    作者用 agent plasticity 衡量一件事:权重冻结时,智能体把经验写成可继承制品,再换成留出能力增益,这个转换有多省。

    深度解读完整解读
  2. 评测与基准arXiv 2610.08215

    Learn2Play Bench 发布:用规则陌生的文本游戏评测 LLM Agent 从经验中学习的能力

    用 Learn2Play Bench 评测 Agent 从经验中学习陌生规则

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 5.5、GPT-6 Astra、Claude Opus 5 等 11 个
    摘要用隐藏规则游戏把新学习与预训练知识分开,并比较模型、记忆方式和人类。

    Learn2Play Bench 用新设计的隐藏规则文本游戏,评测 LLM 智能体在不更新权重时从交互中学习的能力。

    深度解读完整解读
  3. 评测与基准arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道

    发表
    场景
    AI Agent
    被测模型
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  4. 评测与基准arXiv 2610.03153

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    构建 EvoRiskBench 评测工作区 Agent 的运行时安全风险

    发表
    场景
    AI Agent
    被测模型
    GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5

    摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。

    深度解读完整解读
  5. 评测与基准arXiv 2609.39473

    FAME:用反事实推理评测自主智能体的虚假记忆

    提出 FAME,用反事实概念漂移评测智能体虚假记忆

    发表
    被测模型
    Llama-3B
    摘要FAME 用反事实引起的隐状态概念漂移,在出答案前区分忠实记忆与虚假记忆。

    FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。

    深度解读完整解读
  6. 评测与基准arXiv 2609.36130

    论文提出 DerivAudit:审计长期 Agent 记忆是否真由交互历史支持

    提出 DERIVAUDIT 审计长期 Agent 记忆是否由交互历史导出

    发表
    场景
    AI Agent
    被测模型
    Qwen3-30B-A3B、Gemma-4-31B、Llama-3.3-70B-Instruct
    摘要DERIVAUDIT 表明扩历史能补出处,但组合准入与过细检查仍两侧出错。

    DERIVAUDIT 审计长期智能体的持久记忆是否由写入时可获得的交互历史支持,而不是只看以后能否被召回。

    深度解读完整解读
  7. 评测与基准arXiv 2609.35596

    SEABench:评测自演化智能体的内生失配

    提出 SEABench 评测自演化智能体的内生失配

    发表
    场景
    AI Agent
    被测模型
    Kimi K2.5、Grok 4.3、GPT 5.6 Luna
    摘要SEABench 显示无参数自进化能提高任务完成,同时在配对未进化基线安全的下游任务上引入可归因的安全失败。

    SEABench 是一个面向个人助理、参数不更新的自进化智能体基准,用来测量局部适应如何变成后续任务上的内生失配。。

    深度解读完整解读
  8. 评测与基准arXiv 2609.17320

    Emergence World:对长时程多智能体系统开展对抗压力测试

    提出 Emergence World,对长时程多智能体系统开展对抗压力测试

    发表
    被测模型
    Claude Opus 4.8、DeepSeek v4 Pro、Gemini 3.5 Flash 等 9 个

    摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    深度解读完整解读
  9. 研究实测五套 Agent 记忆系统均不执行撤销标记

    评测 Agent 记忆系统的软撤回执行情况,并提出陈旧检索防护

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、Grok-4、DeepSeek-V4-Flash 等 9 个

    摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。

    深度解读完整解读
  10. 评测与基准arXiv 2608.18066

    Salesforce AI Research 重测自改进 Agent

    重测记忆型自改进 Agent 的运行方差与任务顺序敏感性

    发表
    场景
    AI Agent
    被测模型
    GPT-5-mini、Gemini-2.5-Pro、GPT-OSS-120B 等 4 个
    摘要论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。

    这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。

    深度解读完整解读
  11. 评测与基准arXiv 2608.09476

    ActBench:面向协作智能体行为安全的自演化基准

    构建自演化基准 ActBench,评测协作智能体的行为安全

    发表
    场景
    AI Agent
    被测模型
    Claude-Opus-4.8、Claude-Sonnet-4.6、GPT-5.5 等 15 个

    摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。

    深度解读完整解读
  12. ContextWeave:面向长周期办公工作流的智能体记忆基准

    构建 ContextWeave,评测办公工作流智能体记忆的下游增益

    发表
    被测模型
    DeepSeek-V4-Pro、GPT-5.5、GLM-5.1 等 5 个
    摘要ContextWeave 用真实办公任务流检验记忆是否改善工作区质量与偏好对齐。

    ContextWeave 是面向语言智能体记忆的纵向基准,用来看召回先前经验能否让后续办公任务做得更好。

    深度解读完整解读
  13. 多智能体协同过滤系统的连接性攻击与防御研究

    复现 AgentCF 上的多智能体攻防并刻画连通性作用

    发表
    被测模型
    Qwen3-235B-A22B、Claude Haiku 4.5、Mixtral 8×7B 等 4 个
    摘要连通性沿 k 与ρ改变攻防,且用户/物品与早期/稳态需要分开看。

    作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。

    深度解读完整解读
  14. 评测与基准arXiv 2607.14611

    论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险

    评测编码 Agent 记忆文件中提示注入的跨会话影响

    发表
    被测模型
    Claude Haiku 4.5、Claude Opus 4.7、GPT-5.2 等 4 个
    摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。

    Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。

    深度解读完整解读