跳到正文
10月10日 · 周六

全部论文

找到 4 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 241 篇还没打标签,不在筛选结果里。

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2606.12716

    PaperGuard:针对多模态 AI 同行评审的攻击与防御基准

    提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令

    发表
    被测模型
    Claude-sonnet-4.5、GPT-4o、GPT-4.1 等 11 个
    摘要PaperGuard 测到提示注入与白盒视觉抬分,并比较分块检索防御。

    PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。

    深度解读完整解读
  2. 评测与基准arXiv 2512.19016

    DREAM 框架用跨环境长链攻击评测 12 个 LLM Agent

    提出 DREAM 框架,评测 Agent 的跨环境长链攻击脆弱性

    发表
    场景
    AI Agent
    被测模型
    Gemini-2.5-Flash-NT、o4-mini、Gemini-2.5-Flash 等 12 个

    摘要DREAM 提出基于知识图谱与策略搜索的动态红队框架,分析了长链跨环境攻击对当前主流智能体的系统性威胁。

    深度解读完整解读
已经到底了