跳到正文
10月8日 · 周四

全部论文

找到 28 篇

另有 701 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2608.16246

    CompoSkill 框架利用逐个通过扫描的 Agent 技能组合发起攻击

    提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链

    发表
    场景
    AI Agent
    测试
    GPT-5.4、Gemini-3.1-flash、DeepSeek-V4 等 4 个

    摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。

    深度解读完整解读
  2. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    提出 DIBench,评测界面注入对移动智能体选择决策的操纵

    发表
    测试
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  3. 评测与基准arXiv 2610.03938

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测启用工具调用后多模态模型拒答有害图文请求的变化

    发表
    场景
    AI Agent
    测试
    Gemini-2.5-Pro、Gemini-3.1-Pro-Preview、Claude Opus 4.6 等 13 个
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    深度解读完整解读
  4. 评测与基准arXiv 2610.03153

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    提出 EvoRiskBench,评测工作区智能体的运行时安全风险

    发表
    测试
    GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5

    摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。

    深度解读完整解读
  5. MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用 MMPIBench 评测智能体框架的多模态提示注入

    发表
    场景
    AI Agent
    测试
    Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro 等 6 个

    摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    深度解读完整解读
  6. SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御

    发表
    攻击者
    白盒
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3 等 6 个
    摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。

    深度解读完整解读
  7. 评测与基准arXiv 2608.11816

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为

    发表
    测试
    Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B 等 9 个
    摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。

    深度解读完整解读
  8. 评测与基准arXiv 2609.32763

    Mandela-Bench:36 个多模态模型更依赖记忆而非观察图像

    构建 Mandela-Bench,评测多模态模型是否凭记忆接受篡改图像

    发表
    测试
    Gemini-3.8-Flash、GPT-5.6、GLM-5.3-Flash 等 15 个
    摘要论文构建 Mandela-Bench 发现模型对经典图像存在记忆重构偏见,过度依赖先验导致无法有效利用知识核验事实篡改。

    该研究系统评估了多模态大语言模型在面对无痕事实性编辑时,能否利用自身内在世界知识核验被识别出的经典图像。

    深度解读完整解读
  9. SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准

    提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性

    发表
    测试
    GPT-5.4 mini、GPT-5.5、DeepSeek V4 Flash 等 12 个
    摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。

    SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。

    深度解读完整解读
  10. 评测与基准arXiv 2609.35596

    SEABench:评测自演化智能体的内生失配

    提出 SEABench,评测无参数自进化智能体的内生失配

    发表
    场景
    AI Agent
    测试
    Kimi K2.5、Grok 4.3、GPT 5.6 Luna 等 4 个
    摘要SEABench 显示无参数自进化能提高任务完成,同时在配对未进化基线安全的下游任务上引入可归因的安全失败。

    SEABench 是一个面向个人助理、参数不更新的自进化智能体基准,用来测量局部适应如何变成后续任务上的内生失配。。

    深度解读完整解读
  11. 评测与基准arXiv 2609.36562

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险

    发表
    测试
    ThinkingGuard(Qwen3-VL-8B-Instruct)、GPT-5.1、Claude-Sonnet-4-6 等 9 个
    摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。

    这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。

    深度解读完整解读
  12. DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    测试
    Wan、CogVideoX、LTX-Video 等 9 个
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  13. 评测与基准arXiv 2609.38822

    SkillSeek:Agent 技能检索在 Marketplace 规模下的再审视

    提出 SkillSeek,用确定性检索替代智能体技能选择循环

    发表
    场景
    AI Agent
    测试
    Qwen3.5-397B-A17B、MiniMax-M2.7、BGE-base 等 11 个
    摘要SkillSeek 用免训练两阶段 IR 选技能,在所测网格上与 LLM 检索循环的 pass rate 接近且花费更低。

    SkillSeek 把智能体技能选择做成标准信息检索:BGE-base 双编码器取 top-20,小型交叉编码器重排后经 MCP 返回 top-5,检索循环内不再调用 LLM。公开技能聚合已到数十万条,Liu et al. (2026b) 让智能体自己改写查询并精炼候选,每任务都付 token。作者要问的是,这种合成优势在 SkillsBench 上是否经常出现,以及确定性检索能否在 pass rate 上接近它。

    深度解读完整解读
  14. 评测与基准arXiv 2609.35922

    VoxParity 评测:语音智能体在需要听声判断时仍按文字行事

    提出 VoxParity 基准,评测语音智能体是否按音频改变工具调用

    发表
    场景
    AI Agent
    测试
    MiMo-V2.6-Pro、gemini-3.7-flash、Qwen3.8-Omni 等 15 个
    摘要VoxParity 用固定转写的音频对比和 words-only null,测量语音智能体是否按所听内容改变工具调用。

    VoxParity 测量语音智能体在词语不变、只有声音改变时,是否按行业规则改它所执行的工具调用。

    深度解读完整解读
  15. SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件

    发表
    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 5 个

    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。

    深度解读完整解读
  16. 评测与基准arXiv 2608.18607

    VA-Judger:面向联合视频-音频生成的人类偏好反馈奖励建模

    提出 VA-Judger,用人类偏好训练联合音视频奖励模型

    发表
    测试
    Qwen3-Omni、VA-Judger、LTX-2 等 6 个
    摘要VA-Judger 用易到难的人类偏好学习做联合音视频奖励,并用于 LTX-2 后训练。

    VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。

    深度解读完整解读