跳到正文
10月9日 · 周五

全部论文

找到 30 篇

另有 440 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道

    发表
    场景
    AI Agent
    被测模型
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  2. 评测与基准arXiv 2610.03938

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测 ReAct 工具调用对多模态模型拒答有害请求的削弱

    发表
    场景
    AI Agent
    被测模型
    Gemini-2.5-Pro、Gemini-3.1-Pro-Preview、Claude Opus 4.6 等 13 个
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    深度解读完整解读
  3. 评测与基准arXiv 2610.03153

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    构建 EvoRiskBench 评测工作区 Agent 的运行时安全风险

    发表
    场景
    AI Agent
    被测模型
    GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5

    摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。

    深度解读完整解读
  4. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性

    发表
    被测模型
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  5. 评测与基准arXiv 2609.36130

    论文提出 DerivAudit:审计长期 Agent 记忆是否真由交互历史支持

    提出 DERIVAUDIT 审计长期 Agent 记忆是否由交互历史导出

    发表
    场景
    AI Agent
    被测模型
    Qwen3-30B-A3B、Gemma-4-31B、Llama-3.3-70B-Instruct
    摘要DERIVAUDIT 表明扩历史能补出处,但组合准入与过细检查仍两侧出错。

    DERIVAUDIT 审计长期智能体的持久记忆是否由写入时可获得的交互历史支持,而不是只看以后能否被召回。

    深度解读完整解读
  6. 评测与基准arXiv 2609.35596

    SEABench:评测自演化智能体的内生失配

    提出 SEABench 评测自演化智能体的内生失配

    发表
    场景
    AI Agent
    被测模型
    Kimi K2.5、Grok 4.3、GPT 5.6 Luna
    摘要SEABench 显示无参数自进化能提高任务完成,同时在配对未进化基线安全的下游任务上引入可归因的安全失败。

    SEABench 是一个面向个人助理、参数不更新的自进化智能体基准,用来测量局部适应如何变成后续任务上的内生失配。。

    深度解读完整解读
  7. 评测与基准arXiv 2609.35922

    VoxParity 评测:语音智能体在需要听声判断时仍按文字行事

    提出 VoxParity,固定转写只改音频,评测语音智能体是否按行业规则改工具调用

    发表
    场景
    AI Agent
    被测模型
    MiMo-V2.6-Pro、gemini-3.7-flash、Qwen3.8-Omni 等 15 个
    摘要VoxParity 用固定转写的音频对比和 words-only null,测量语音智能体是否按所听内容改变工具调用。

    VoxParity 测量语音智能体在词语不变、只有声音改变时,是否按行业规则改它所执行的工具调用。

    深度解读完整解读
  8. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作

    发表
    被测模型
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
  9. 评测与基准arXiv 2609.33481

    IDUnlearn-Bench:面向视觉语言模型的个体级遗忘基准

    提出 IDUnlearn-Bench,评测 VLM 个体级遗忘后的身份残留

    发表
    被测模型
    Qwen3-VL-2B、Qwen3-VL-4B、Qwen3-VL-8B 等 6 个
    摘要IDUnlearn-Bench 用四族探针显示:压低直接属性访问后,身份仍常能被反向查出、绑定或重构。

    IDUnlearn-Bench 评测 VLM 是否忘掉一个可跨模态识别的人,而不只是答不出某条监督事实。

    深度解读完整解读
  10. 评测与基准arXiv 2609.17320

    Emergence World:对长时程多智能体系统开展对抗压力测试

    提出 Emergence World,对长时程多智能体系统开展对抗压力测试

    发表
    被测模型
    Claude Opus 4.8、DeepSeek v4 Pro、Gemini 3.5 Flash 等 9 个

    摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    深度解读完整解读
  11. MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用 MMPIBench 评测多模态提示注入对 Agent 框架的影响

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro 等 6 个

    摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    深度解读完整解读
  12. 研究实测五套 Agent 记忆系统均不执行撤销标记

    评测 Agent 记忆系统的软撤回执行情况,并提出陈旧检索防护

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、Grok-4、DeepSeek-V4-Flash 等 9 个

    摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。

    深度解读完整解读
  13. Mind2Web-Injection:面向网页 Agent 视觉提示注入护栏的证据对齐评测

    提出 Mind2Web-Injection 评测网页 Agent 视觉注入护栏

    发表
    被测模型
    GPT-5.6-luna、Qwen3-VL-32B、Qwen3-VL-8B 等 6 个
    摘要作者称检测、定位和反事实响应在六个 VLM 上可分开。

    Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。

    深度解读完整解读