跳到正文

提示注入 · 精选

10月9日 · 周五

提示注入 · 精选

今天还没有新的精选
10月3日周六
  1. Gray Swan AI · 56

    UK AISI 与 Gray Swan 2025 年智能体红队挑战结果:180 万次尝试、6.2 万次攻破

    Gray Swan AI 在 2025 年 5 月 9 日的博客里公布与 UK AISI 合办的智能体红队挑战结果。挑战为期一个月(2025 年 3 月 8 日至 4 月 6 日),共发起 180 万次攻击尝试,社区成功攻破 6.2 万次,覆盖 22 个模型(挑战期间匿名)和 44 种有害智能体行为,奖金总额 171,800 美元。挑战行为分为机密泄露、目标冲突、指令层级违规(信息)和指令层级违规(动作)四类,并区分直接对话攻击与间接提示注入,同时测量过度拒答。161 名红队成员获奖,前 10 名获得 Gray Swan 与 UK AISI 的快速通道面试机会,前 5 名各取得 924 次唯一攻破。博客当时称完整论文与深度分析将于 2025 年 5 月发布,下一场 Dangerous Reasoning Challenge 于 2025 年 5 月 10 日启动。

10月1日周四
  1. Jev Gateway Study、CiscoJev Gateway Study 等 2 个来源 · 2 篇报道 · 58

    Jev 网关提示注入检测器基准测试

    2026年10月1日,Jev 在 GitHub 发布提示注入检测器基准测试,在同一台 Apple M4 机器上对比 Jev 1.13.0、Kev-4B、Kev-0.8B、Laya、GLiNER2.5-Decide、ProtectAI DeBERTa、Prompt Guard 2 及关键词规则,覆盖文档块注入与用户消息越狱两类任务。文档块测试中,Jev AUC 为 1.00、冻结阈值下召回 100%、误报 8%;Kev-4B 为 0.90 和 70%;Prompt Guard 2 为 0.83 和 19%。2026年10月6日,思科发布内容安全任务对比评测,在 24 个危害类别、6 个评测数据集上对比零样本决策模型 Jev(TypeSafe)与 Laya(ConvAI Innovations)及自训练的 1B 参数编码器分类器;在 0.5% 误报预算下,自训练模型在全部 6 个数据集上召回率最高,Jev 在 6 个中的 5 个 AUC 领先 Laya。思科多轮测试集上,自训练模型召回 61%、Jev 34%、Laya 几乎为零。

    事件进展
    1. Cisco对比决策模型与分类器的内容安全评测

    2. Jev网关提示注入检测器基准测试

  2. Google DeepMind、X @GoogleDeepMind 等 5 个来源Google DeepMind 等 5 个来源 · 5 篇报道 · 59

    Google发布Gemini 4 Argon前沿模型

    2026年9月30日至10月1日,Google DeepMind发布前沿模型Gemini 4 Argon,先通过Fairwind Program向一批受信任的网络防御者开放,并参与美国政府的前置模型访问自愿流程,之后再逐步扩展到开发者、企业和消费者。Argon面向长周期复杂工作流,输出token上限从64K提升到1M,在DeepSWE v1.1上取得77.9%,在LVBench长视频理解上取得91.7%。Google称其在编程、企业办公、科学与数学以及网络安全等基准上达到SOTA,可对标Anthropic与OpenAI的竞品,上下文窗口扩大16倍,内部已用于量子计算研究、数据中心内存优化和自动化编程。该模型能自主定位、验证并修补关键软件漏洞,会向受信任防御方及Google内部团队提供不带网络护栏的版本,Google称其更抗提示注入,并将根据测试者反馈微调护栏。开发者、企业和消费者稍后可用,先面向付费API客户和Google AI Ultra订阅者。Google首席AI架构师Koray Kavukcuoglu表示,安全释放这一级别的前沿能力需要分阶段推进,公司还主动向美国政府提供早期访问权限。

已经到底了