跳到正文
10月9日 · 周五

全部论文

找到 98 篇
筛选3

另有 444 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2606.09700

    研究者提出 HPAA 攻击:用排版视觉线索绕过 13 个内容审核系统

    提出 HPAA 攻击,用排版视觉线索绕过内容审核系统

    发表
    攻击者
    黑盒
    摘要揭示了排版视觉线索与分词差异带来的审核盲区,HPAA 以极低查询实现近乎完全规避。

    这篇论文研究了人类视觉感知与大模型分词处理机制之间的差异所导致的内容审核漏洞。

    深度解读完整解读
  2. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器

    发表
    攻击者
    黑盒、灰盒

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  3. 评测与基准arXiv 2610.07939

    CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出

    提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别

    发表

    摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。

    深度解读完整解读
  4. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角

    发表
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  5. 评测与基准arXiv 2610.07359

    论文实测 Agent 工具调用门控栈的失败相关性

    提出 nmult,实测 Agent 动作门控栈的层间错误相关性

    发表
    场景
    AI Agent
    摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。

    论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。

    深度解读完整解读
  6. 防御arXiv 2603.01544

    RA-Det:利用鲁棒性不对称检测 AI 生成图像

    提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像

    发表
    摘要RA-Det 把扰动下特征漂移差变成检测信号,平均 ACC 高于表中通用检测器,但不是每行最高。

    RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。

    深度解读完整解读
  7. 防御arXiv 2608.17776

    辩论训练在 RLAIF 中减少奖励作弊

    提出常和辩论训练,减轻弱评审下 RLAIF 的奖励作弊

    发表
    摘要辩论式 RL 在数学题上维持弱评审的 MCC,验证峰值准确率高于单人基线并更持久。

    作者在可核对最终答案的数学题上,比较辩论式 RLAIF 与单人 RLAIF 的奖励黑客动态。

    深度解读完整解读