跳到正文
10月8日 · 周四

全部论文

找到 13 篇

另有 709 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    提出 DIBench,评测界面注入对移动智能体选择决策的操纵

    发表
    测试
    GPT-5.2、Qwen2.5-VL(32B)、Qwen3-VL(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  2. 评测与基准arXiv 2610.03938

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测启用工具调用后多模态模型拒答有害图文请求的变化

    发表
    场景
    AI Agent
    测试
    GPT-5.4、Gemini-2.5-Pro、Gemini-3.1-Pro-Preview 等 13 个
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    深度解读完整解读
  3. 评测与基准arXiv 2610.05586

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    构建 AGENTDOXX 评测联网搜索智能体对匿名访谈的再识别能力

    发表
    场景
    AI Agent
    测试
    GPT-5.6 Terra、GPT-5 Mini、GPT-4.1 Mini 等 10 个

    摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。

    深度解读完整解读
  4. MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用 MMPIBench 评测智能体框架的多模态提示注入

    发表
    场景
    AI Agent
    测试
    GPT-5.4、gpt-audio、Claude Opus 4.8 等 6 个

    摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    深度解读完整解读
  5. 评测与基准arXiv 2609.31342

    研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案

    构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答

    发表
    测试
    GPT-4o、GPT-4.1、GPT-5.5 等 13 个
    摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。

    这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。

    深度解读完整解读
  6. Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息

    构建 COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲 GEO 的防御

    发表
    测试
    GPT 5.5、Gemma-4-31B-IT、Qwen-3.5-35B-A3B 等 11 个

    摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。

    深度解读完整解读
  7. 评测与基准arXiv 2609.32763

    Mandela-Bench:36 个多模态模型更依赖记忆而非观察图像

    构建 Mandela-Bench,评测多模态模型是否凭记忆接受篡改图像

    发表
    测试
    GPT-5.6、Gemini-3.8-Flash、GLM-5.3-Flash 等 15 个
    摘要论文构建 Mandela-Bench 发现模型对经典图像存在记忆重构偏见,过度依赖先验导致无法有效利用知识核验事实篡改。

    该研究系统评估了多模态大语言模型在面对无痕事实性编辑时,能否利用自身内在世界知识核验被识别出的经典图像。

    深度解读完整解读
  8. SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准

    提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性

    发表
    测试
    GPT-5.4 mini、GPT-5.5、DeepSeek V4 Flash 等 12 个
    摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。

    SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。

    深度解读完整解读
  9. 评测与基准arXiv 2609.36562

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险

    发表
    测试
    GPT-5.1、OpenAI Moderation API、ThinkingGuard(Qwen3-VL-8B-Instruct) 等 9 个
    摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。

    这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。

    深度解读完整解读
  10. DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    测试
    Open-Sora、Sora 2、Wan 等 9 个
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  11. 评测与基准arXiv 2609.39146

    MADBench:多智能体辩论安全性评测基准发布

    发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响

    发表
    测试
    gpt-4o、GPT-5、GPT-6 Astra
    摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。

    MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。

    深度解读完整解读
  12. CONFLICTGUI 基准与 CONFLICTGUARD 框架:让多模态 GUI Agent 学会在冲突指令下终止执行

    AI 导读作者提出 CONFLICTGUI 基准,覆盖指令内部冲突与指令和 GUI 上下文冲突两类场景,用于研究 GUI Agent 的冲突感知终止能力。

    发表
    测试
    GPT-5、UI-Venus-1.5-8B、UI-TARS-1.5-7B 等 10 个
    摘要ConflictGUI 暴露 GUI 智能体的执行偏向过度服从,ConflictGuard 用条件转向提高冲突终止率。

    ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。

    深度解读完整解读
  13. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    构建多模态技能图像攻击基准 MMSkillRisk 并设计 NCVA

    发表
    测试
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
已经到底了