跳到正文
10月8日 · 周四

全部论文

找到 10 篇

另有 725 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.03938

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测启用工具调用后多模态模型拒答有害图文请求的变化

    发表
    场景
    AI Agent
    测试
    Gemini-2.5-Pro、Gemini-3.1-Pro-Preview、Claude Opus 4.6 等 13 个
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    深度解读完整解读
  2. 评测与基准arXiv 2609.36562

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险

    发表
    测试
    ThinkingGuard(Qwen3-VL-8B-Instruct)、GPT-5.1、Claude-Sonnet-4-6 等 9 个
    摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。

    这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。

    深度解读完整解读
  3. DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    测试
    Wan、CogVideoX、LTX-Video 等 9 个
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  4. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    发表
    攻击者
    黑盒
    测试
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  5. 评测与基准arXiv 2609.27336

    CART:面向大语言模型的闭环自适应红队框架

    提出闭环自适应红队框架 CART,评测模型与工具 Agent 的风险面

    发表
    场景
    AI Agent
    测试
    Claude Opus 4.8、GPT-5.5、Grok 4.3 等 7 个
    摘要CART 把红队做成可审计的闭环搜索,在三类评测上比静态回放发现更多失败与更高平均风险。

    CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。

    深度解读完整解读
  6. FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0

    建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力

    发表
    测试
    Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 等 8 个
    摘要论文系统评测了前沿模型对已知静态越狱的防御能力,揭示了厂商间防护鲁棒性的巨大分化。

    本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。

    深度解读完整解读
已经到底了