跳到正文
10月10日 · 周六

全部论文

找到 7 篇
筛选7
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2609.35381

    研究:MCP 错误信息面向开发者,能力越强的 Agent 受损越大

    测量面向开发者的 MCP 错误信息对工具调用 Agent 恢复的影响

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、GPT-5.6 Sol、GPT-6 Sol 等 5 个
    摘要面向开发者的 MCP 错误步骤会让只能调用工具的智能体停手。

    MCP 错误信息里的下一步常常按人类开发者来写,而只能调用服务器工具的智能体会照着做。做不到就结束回合。作者先统计这类文本,再在 BFCL V4 上只更换错误文本,看回合状态能否回到参考调用之后。

    深度解读完整解读
  2. 其他arXiv 2609.08832

    自进化智能体框架缩小 LLM 智能体的「一致性差距」

    提出离线两阶段框架,诊断易翻转步骤并生成记忆指南以稳定智能体

    发表
    场景
    AI Agent
    被测模型
    GPT-4.1、GPT-OSS-120B
    摘要用离线一致性诊断生成记忆指南,在 AppWorld 上提高重复全通过率。

    作者要缩小的是 LLM 智能体平均通过、重复不稳之间的 consistency gap,即 Mean@k 减 Passˆk。

    深度解读完整解读
  3. 评测与基准arXiv 2608.18066

    Salesforce AI Research 重测自改进 Agent

    重测记忆型自改进 Agent 的运行方差与任务顺序敏感性

    发表
    场景
    AI Agent
    被测模型
    GPT-5-mini、Gemini-2.5-Pro、GPT-OSS-120B 等 4 个
    摘要论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。

    这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。

    深度解读完整解读
  4. 攻击arXiv 2608.12273

    研究者提出 Convergent Detour Hijacking 攻击,可让技能型 LLM Agent 绕路并放大资源消耗

    提出 CDH 攻击,让技能型 Agent 绕路放大资源消耗

    发表
    场景
    AI Agent
    被测模型
    Claude-Haiku-4.5、DeepSeek-V4-Pro、DeepSeek-V4-Flash 等 6 个
    摘要CDH 让静态技能在保持任务完成时拉高调用与 token,耗时则因后端而异。

    CDH 是针对渐进披露技能智能体的发布者侧、纯文本攻击:一个静态协调器把本可正确完成的任务,拐进有界但更耗资源的技能绕路,再交还原任务。

    深度解读完整解读
  5. 攻击arXiv 2605.30040

    研究揭示 LLM 按 token 计费可被服务商系统性虚报

    构造可通过计费审计的 token 虚报,使服务商系统性超收

    发表
    被测模型
    PALACE domain-adapted auditor
    摘要不诚实提供方可在三种 token 审计上虚报并通过检查,作者认为需改用提供方不控制的证据。

    不透明 LLM 的按 token 计费里,现有审计核验的是提供方可控的证据,不诚实提供方可以虚报并通过检查。。

    深度解读完整解读
已经到底了