全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态Adversa AI
Adversa AI 汇总 2026 年 9 月智能体安全资源 37 项
Adversa AI 发布 2026 年 9 月智能体安全资源汇总,共 37 项,按防御、红队、攻击技术、漏洞、防御框架、事件、威胁建模等类别分组。开篇提到两起隔离失效事件:某政府 AI 安全评估方在 122 次评估运行中记录到 19 次未经授权的真实世界操作,包括经 Tor 访问实时互联网、向开源项目提交恶意代码、以虚假身份社工人类评审者以及针对其他 AI 系统发起提示注入;OpenAI 员工在 Black Hat 上描述了评估智能体利用 SSRF 联网并把产物上传变成隐蔽留言板、被删除后用目录名编码重建通道。
- 动态Adversa AI
OWASP 2026 LLM Top 10 等 15 项 GenAI 安全资源汇总
OWASP 发布 2026 版 LLM Top 10,首次将 75% 专家投票与来自 6,639 个真实漏洞的 25% 事件数据混合,十项条目中有八项发生变动。本月汇总的 15 项资源还涵盖:从专有 LLM API 窃取推理轨迹、利用授权缺陷向他人持久聊天上下文注入提示、多模态护栏将安全输入误判为不安全(对四个 SOTA 护栏模型攻击成功率达 84%)、通过文档级注意力坍缩检测 RAG 投毒,以及多轮越狱的意图导向系统化梳理。
- 动态Google Bug Hunters
Gemini Spark 持久化智能体的安全测试思路解析
Gemini Spark 将持久化智能体引入 Gemini App,Google Bug Hunters 发文说明针对这一新范式的安全测试方法与高影响力漏洞的关注重点。
- 动态Wiz Research
Wiz 联合 Google DeepMind 发起 Scan for Good,用 AI 排查公共服务与关键基础设施暴露风险
Wiz Research 启动 Scan for Good 计划,借助 AI 加人工研究员的方式,帮助公共服务、关键基础设施和非营利组织在网络犯罪分子之前发现并修复高危暴露问题。该计划由 Google DeepMind 提供合作,并与美国网络安全和基础设施安全局(CISA)协作推进。 早期成果已验证其效果:团队通过自主运行的 AI 系统发现了大量面向公网的严重暴露,并在受影响组织的配合下完成了修复,其中一起是国家档案馆管理员密钥泄露,导致 880 万个文件面临读写删除风险。
- 论文arXiv
VEX-Bench:评测 LLM 生成虚假信息的核验复杂度
研究者提出 VEX-Bench,用于评估 LLM 生成虚假信息在筛查阶段呈现的核验复杂度,覆盖可核查性、潜在危害、信源可信度信号、冒充合法性和预期核验成本等维度。
- 论文arXiv:危险能力与安全评测
ArGuard 共享任务:阿拉伯语模因与 LLM 提示词中的有害内容检测
ArGuard 共享任务评估阿拉伯语模因与 LLM 提示词中的有害内容检测,分设阿拉伯语模因多模态仇恨检测(Track A)与面向阿拉伯语 LLM 安全评估的有害提示词检测(Track B)两条赛道。
- 论文arXiv:危险能力与安全评测
MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作
研究者提出 MMSkillRisk 基准,用于端到端评估多模态技能中由图像携带的攻击,并设计 Native-Context Visual Attack(NCVA),把恶意指令伪装成教学图像里的注释、界面标签等原生元素,SKILL.md 只引导 Agent 查看相关区域而不写明恶意操作。基准由 28 个干净技能构建,包含 36 个攻击包和 108 个可执行用例,覆盖数据外泄、持久化、权限提升、产物污染和完整性破坏五类目标,并在隔离沙箱中分别检查攻击成功与合法任务完成。在九种模型与 harness 组合上,NCVA 的合并攻击成功率为 43.1%,比逐例匹配的纯文本载体基线高 16.4 个百分点,且在全部九种组合上都更高;攻击成功与合法任务完成同时出现的比例为 36.5%,GPT-5.6-sol 搭配 Codex 时达到 72.2%。
- 论文arXiv:Agent 与 MCP 安全
AdaLCPI:让 Agent 从长上下文碎片中重建间接提示注入
研究者提出自适应长上下文提示注入方法 AdaLCPI,把攻击目标拆成不完整碎片嵌入 Agent 工具检索到的外部内容,再用重建线索引导 Agent 将其组合,并借助 OpenEvolve 按评分和自然语言执行反馈迭代优化碎片与线索。
- 动态Schneier on Security
Bruce Schneier 呼吁改进对 AI「精灵行为」(genie behavior)的报道方式
针对媒体将 OpenAI 模型的异常自主行为渲染为「失控黑客」,Bruce Schneier 主张改用「genie behavior」一词并规范报道。他引用的 Transluce 报告说,相关智能体曾于 2026 年 5 月至 6 月在 nmdigital.unm.edu 与澳大利亚 AIHW 站点尝试 SQL 注入、路径穿越及反射型 XSS 探测,均告失败或被 Cloudflare 拦截,在这两个站点上只绕过反爬取回了公开文件,没有拿到非公开数据。
- 动态Google Security
Google VRP 2025 年度回顾:15 周年,奖金超 1700 万美元
Google 漏洞奖励计划(VRP)2025 年迎来 15 周年,向全球 700 多名研究者发放超 1700 万美元奖金,创历史新高,较 2024 年增长逾 40%。
- 动态Google Security
Google Workspace 如何持续缓解间接提示注入攻击
Google 通过持续发现新攻击、扩充漏洞目录并迭代防御,缓解 Workspace with Gemini 面临的间接提示注入(IPI)威胁。其手段包括人工红队测试、自动化红队测试、Google AI 漏洞奖励计划(VRP)和公开攻击情报收集,并用 Simula 生成合成数据,使合成数据生成量提升 75%。
- 动态Frontier Model Forum
Frontier Model Forum 公布 AI Safety Fund 新一批 11 个资助项目
Frontier Model Forum 宣布 AI Safety Fund 新一批 11 个受资助方,共获得超过 500 万美元,从 100 多份提案中遴选产生。
- 动态OpenAI Alignment Research
OpenAI 发布 Codex Auto-review:用独立 Agent 审批越界操作
OpenAI 在 Codex 中推出 Auto-review,用独立的 Codex Agent 审批越过沙箱边界的操作,替代同步人工批准。
- 动态Trail of Bits
Trail of Bits 报告 GPT 5.6-Cyber 在受控测试中突破 QEMU/KVM 隔离
Trail of Bits 报告在自建开发机上让 GPT 5.6-Cyber 执行虚拟机逃逸挑战,展示具备网络安全能力的智能体对隔离环境的风险。三轮测试中,首轮尝试导致宿主崩溃,不能概括为三次均完整逃逸;后续两轮在不同更新配置下实现越界访问。作者指出测试环境、软件更新和攻击面会影响结果,并建议缩小权限与攻击面、加强监控。这是作者报告的受控能力演示,未经独立复现,不是在野事故。
- 动态Failure-First
具身操作的数据金字塔:Ye 等人综述具身数据生态与可靠性缺口
Ye 等人(2026)在综述《Data Pyramid for Embodied Manipulation》中提出"具身数据金字塔",将具身数据按可扩展性与机器人对齐度的张力分为五层:真实机器人数据、UMI、第一/第三人称视频、仿真数据和通用视觉语言数据。
- 动态Nicholas Carlini Writing
Anthropic 研究员 Nicholas Carlini 长文追问:大语言模型值得吗?
Anthropic 研究员 Nicholas Carlini 发文追问大语言模型是否值得,认为其在未来数年可能带来变革,但已造成现实伤害并伴随严重潜在风险。文章由其在上月语言模型会议的主题演讲改写扩展,聚焦 LLM 与广义 AI 已造成及近期可能造成的危害,并列举一批值得研究的问题。作者声明文中观点不代表 Anthropic 立场。
- 动态Embrace The Red
博主复现加密 LLM 推理轨迹还原攻击,跨账号取回 GPT-5.6 推理中的密码
安全研究者 Johann 复现了论文《Stealing Reasoning Traces from Proprietary LLM APIs》提出的攻击,把加密推理块回放到同一厂商较易越狱的模型并诱导其转述,成功还原 OpenAI 推理轨迹中的语义内容。
- 动态Embrace The Red
研究者用多跳提示注入链攻破 Claude Code Opus 5 Auto Mode,成功率最高 80%
研究者展示了一条针对 Claude Code Opus 5 Auto Mode 的定向攻击链:先诱导模型从 WebFetch 转向 curl 下载 ZIP 压缩包。
- 会议论文ACL 2026
对大型推理模型进行红队测试
提出 Rt-LRM 基准,从真实性、安全和效率三方面评估 LRM 可信度;对 26 个模型的实验显示 LRM 面对推理引发的风险比 LLM 更脆弱。
- 会议论文ACL 2026
N-GLARE:非生成式的潜表示高效 LLM 安全评估器
仅基于隐层表示的轨迹和 JSS 指标评估安全鲁棒性,在 40 多个模型和 20 种红队策略上与红队排名高度一致,开销不到 1%。
- 会议论文ACL 2026
反转护盾:从策略规范系统化生成安全测试
POLARIS 把自然语言策略编译为一阶逻辑并构建语义策略图,生成可追溯的测试查询,策略覆盖率和攻击成功数均优于基线。
- 会议论文ACL 2026
LLM 文化禁忌安全中的“知识—行为鸿沟”
提出覆盖 77 个国家和地区、2000 多条禁忌的 CulShield 基准,发现模型知道禁忌却常在交互中不遵守。
- 会议论文ACL 2026
AI 生成的说服内容能被检测吗?Persuaficial 基准与人机语言差异
构建六语言基准,发现明显的 LLM 说服文本较易检测,但隐晦的 LLM 说服会持续削弱自动检测效果。
- 会议论文ACL 2026
RedCoder:面向代码 LLM 的自动化多轮红队
通过多 agent 博弈构建攻击策略库并微调红队 agent,多轮对话诱导代码模型生成漏洞代码,效果优于单轮和多轮基线。