跳到正文
10月9日 · 周五

全部论文

找到 119 篇
筛选8

另有 445 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.11112

    EpiReal-Bench:商用图像生成模型虚假声明红队基准

    构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据

    发表
    攻击者
    黑盒
    被测模型
    GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
    摘要四款商用图像模型能把假主张画成可信证据。

    EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。

    深度解读完整解读
  2. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器

    发表
    攻击者
    黑盒、灰盒

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  3. 评测与基准arXiv 2610.07939

    CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出

    提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别

    发表
    被测模型
    C2P-CLIP、ForgeLens、D3-Im 等 10 个

    摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。

    深度解读完整解读
  4. 攻击arXiv 2610.09819

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门

    发表
    被测模型
    HuBERT-base、WavLM-base

    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    深度解读完整解读
  5. 攻击arXiv 2604.02623

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆

    发表
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    深度解读完整解读
  6. 防御arXiv 2610.07774收录

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    AI 导读研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。

    收录
    被测模型
    Qwen3-VL-30B-A3B-Instruct、Kimi-VL-A3B-Instruct
    摘要读出而非操纵 router logits,可在不改模型的情况下降低两模型的组合式安全错误。

    作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。

    深度解读完整解读
  7. 攻击arXiv 2610.07723

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    发表
    被测模型
    Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    深度解读完整解读
  8. 评测与基准arXiv 2610.04737

    PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督

    提出 PyINE 基准,训练捷径跟随模型并比较监督者

    发表
    被测模型
    shortcut-following model organism、gpt-4o、gpt-5 等 12 个
    摘要PyINE 用可验证代码执行研究捷径失败的监督覆盖与成本权衡。

    PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。

    深度解读完整解读
  9. 防御arXiv 2608.17776

    辩论训练在 RLAIF 中减少奖励作弊

    提出常和辩论训练,减轻弱评审下 RLAIF 的奖励作弊

    发表
    摘要辩论式 RL 在数学题上维持弱评审的 MCC,验证峰值准确率高于单人基线并更持久。

    作者在可核对最终答案的数学题上,比较辩论式 RLAIF 与单人 RLAIF 的奖励黑客动态。

    深度解读完整解读
  10. 防御arXiv 2610.06001

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出 AgentSpy,在系统调用层观测 Agent 并检测技能注入

    发表
    被测模型
    gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    深度解读完整解读
  11. 评测与基准arXiv 2610.04575

    论文提出 Operational Validity Contract,审计激活监控从探针分数到告警策略的有效性

    提出操作有效性契约,审计激活监控的告警策略

    发表
    被测模型
    Qwen2.5-7B-Instruct、Llama-3.2-3B、Qwen2.5-7B
    摘要论文建立从探针得分到警报策略的审计框架,实证表明高 AUROC 不等于部署有效性,仅支持受限预测价值。

    这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。

    深度解读完整解读