跳到正文
10月10日 · 周六

全部论文

找到 3 篇
筛选7
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 196 篇还没打标签,不在筛选结果里。

另有 196 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2609.35922

    VoxParity 评测:语音智能体在需要听声判断时仍按文字行事

    提出 VoxParity,固定转写只改音频,评测语音智能体是否按行业规则改工具调用

    发表
    场景
    AI Agent
    被测模型
    MiMo-V2.6-Pro、gemini-3.7-flash、Qwen3.8-Omni 等 15 个
    摘要VoxParity 用固定转写的音频对比和 words-only null,测量语音智能体是否按所听内容改变工具调用。

    VoxParity 测量语音智能体在词语不变、只有声音改变时,是否按行业规则改它所执行的工具调用。

    深度解读完整解读
  2. MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用 MMPIBench 评测多模态提示注入对 Agent 框架的影响

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro 等 6 个

    摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    深度解读完整解读
  3. 攻击arXiv 2507.10457

    论文提出 LPCI:针对 Agent 逻辑层与持久记忆的提示控制注入攻击

    提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发

    发表
    场景
    AI Agent
    被测模型
    ChatGPT、Claude、LLaMA3 等 8 个
    摘要作者定义 LPCI。

    作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。

    深度解读完整解读
已经到底了