跳到正文
10月8日 · 周四

全部论文

找到 5 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 701 篇还没打标签,不在筛选结果里。

另有 701 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.03938

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测启用工具调用后多模态模型拒答有害图文请求的变化

    发表
    场景
    AI Agent
    测试
    Gemini-2.5-Pro、Gemini-3.1-Pro-Preview、Claude Opus 4.6 等 13 个
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    深度解读完整解读
  2. 评测与基准arXiv 2608.11816

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为

    发表
    测试
    Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B 等 9 个
    摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。

    深度解读完整解读
  3. 评测与基准arXiv 2609.35922

    VoxParity 评测:语音智能体在需要听声判断时仍按文字行事

    提出 VoxParity 基准,评测语音智能体是否按音频改变工具调用

    发表
    场景
    AI Agent
    测试
    MiMo-V2.6-Pro、gemini-3.7-flash、Qwen3.8-Omni 等 15 个
    摘要VoxParity 用固定转写的音频对比和 words-only null,测量语音智能体是否按所听内容改变工具调用。

    VoxParity 测量语音智能体在词语不变、只有声音改变时,是否按行业规则改它所执行的工具调用。

    深度解读完整解读
  4. AV-SafetyBench:面向文本到音视频生成的安全基准

    提出 AV-SafetyBench 评测文生音视频模型的不安全生成

    发表
    测试
    LTX-2.3、Ovi-1.1、JavisDiT++ 等 7 个
    摘要AV-SafetyBench 用三视角评五个 T2AV 模型,显示只看视频会漏掉音频与联合风险。

    AV-SafetyBench 是面向文本生成音视频(T2AV)的安全基准:一条提示词同时规定画面和音频,评测同时看两轨以及它们的交互。作者要测的是,不安全含义不只出现在画面上:它可以主要由语音或声音承载,也可以只有两轨合起来才成立。T2VSafetyBench 不评音频,TTA-Bench 不评与画面的交互,作者认为二者都盖不住这些路径。

    深度解读完整解读
  5. CONFLICTGUI 基准与 CONFLICTGUARD 框架:让多模态 GUI Agent 学会在冲突指令下终止执行

    AI 导读作者提出 CONFLICTGUI 基准,覆盖指令内部冲突与指令和 GUI 上下文冲突两类场景,用于研究 GUI Agent 的冲突感知终止能力。

    发表
    测试
    UI-Venus-1.5-8B、UI-TARS-1.5-7B、OS-Atlas-Base-7B 等 10 个
    摘要ConflictGUI 暴露 GUI 智能体的执行偏向过度服从,ConflictGuard 用条件转向提高冲突终止率。

    ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。

    深度解读完整解读
已经到底了