跳到正文
10月9日 · 周五

全部论文

找到 7 篇

另有 428 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角

    发表
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  2. 其他arXiv 2609.16694

    面向安全 AI 渗透测试智能体:安全威胁、护栏与架构视角

    综述自主渗透智能体的继承攻击、架构攻击及护栏覆盖缺口

    发表
    场景
    AI Agent
    摘要用双轴分类连接渗透智能体的架构、攻击与护栏,并认为现有防御仍按组件分开。

    这是一篇关于自主 AI 渗透测试智能体的安全综述:用架构和生命周期两轴整理威胁与护栏,不做新的攻击实验。

    深度解读完整解读
已经到底了