CoSAI 发布两份新的智能体身份与安全研究报告
继在 RSAC Conference 2026 高调亮相后,全球多方利益相关方倡议组织 Coalition for Secure AI(CoSAI)发布了智能体身份与安全方向的两份新研究论文,旨在帮助各类组织应对不断演变的 AI 安全格局。该联盟称此举是其通过技术指导与产业参与推动实用化 AI 系统安全的整体行动的一部分,完整新闻稿发布于 OASIS 官网。
开源红队、评测与防护工具。
在这个话题内搜索或按分类筛选继在 RSAC Conference 2026 高调亮相后,全球多方利益相关方倡议组织 Coalition for Secure AI(CoSAI)发布了智能体身份与安全方向的两份新研究论文,旨在帮助各类组织应对不断演变的 AI 安全格局。该联盟称此举是其通过技术指导与产业参与推动实用化 AI 系统安全的整体行动的一部分,完整新闻稿发布于 OASIS 官网。
安全人工智能联盟(CoSAI)成立两年之际公布其智能体安全工作进展,涵盖《The Future of Agentic Security: From Chatbots to Autonomous Swarms》报告及在 RSAC 2026 发布的 MCP 安全和智能体身份研究成果。该组织通过四个工作流推进最佳实践共享,并新增 OWASP、AI Alliance 和云安全联盟加入技术指导委员会。下一步将发布面向 AI/ML 供应链信任与溯源的工件完整性成熟度模型、Zero Trust for AI Systems 以及 MCP 安全指南第二版。
CoSAI(隶属 OASIS Open Project)于 8 月 28 日召开混合形式工作会议,推进面向 AI 智能体的开放委派与身份标准 ODIS,会上进行了两场早期实现现场演示并收集反馈。该标准定义跨企业信任域的供应商中立密码学身份架构,通过扩展 OAuth 2.0、OpenID Connect(OIDC)、SPIFFE 和 SCIM 来满足智能体 AI 的身份、委派与治理需求,由 CoSAI Workstream 4 负责制定。
CoSAI Workstream 4 于 2026 年 8 月 12 日发布 MCP Security v2.0,在 v1 的十二类威胁、三十四项威胁基础上新增安全保证等级,解决 v1 缺少按部署规模分级的问题。v2.0 定义四级累积等级,从 Level 1 沙箱、Level 2 内部、Level 3 生产到 Level 4 受监管,每级在身份与认证、授权与委托、传输与网络安全、隔离与沙箱、日志与可观测性、供应链与生命周期、工具与输入输出完整性、状态与发现安全八个维度给出 MUST/SHOULD 要求,并逐条映射到 MCP-T1 至 MCP-T12 威胁类别和 OWASP MCP Top 10。文中指出 Level 3 硬性要求 token 绑定,缺少 DPoP 或 mTLS 时被攻陷的 agent 上下文可被重放;等级由数据敏感度和影响范围决定,而非部署形态。
MLCommons 与 Google DeepMind、OpenMined、AVERI 合作完成了全球首个针对闭源模型的双重盲评概念验证,通过密码学保证在不暴露双方资产的前提下运行评测。该方案由 AVERI 借助 OpenMined 的安全计算执行,在一个容器化的 Google DeepMind 模型中运行来自 AILuminate 安全基准预留子集的提示词,确保被测模型此前从未接触过这批题目。此举使开发者看不到测试数据、仪器方(MLCommons)与审计方(AVERI)也拿不到模型的权重,从而避免污染基准并维持其完整性。
Stanford CRFM 与 Arabic.AI 合作推出 HELM Arabic Enterprise,基于 HELM 方法论对企业用例下的阿拉伯语大语言模型进行透明可复现评测。该榜单涵盖六项任务——文章生成、金融多选题问答、金融布尔判断题、金融计算题以及法律开卷与闭卷问答,各实例按 0 到 1 打分并取宏平均作为模型得分。其中文章生成由 LLM-as-judge 从忠实性、完整性和风格遵循三个维度评分,用以惩罚模型幻觉与遗漏关键事实等问题。
ARC 与非营利组织 AIcrowd 合作启动 ARC White-Box Estimation Challenge,面向随机初始化的宽 MLP 征集能降低期望输出均方误差的白盒估计算法。热身轮于本周开始,后续轮次总奖池至少 $100,000,固定宽度 n=256、隐藏层数 L=8,并配套设计了一套 FLOP 计数方案以减少高度优化数值内核带来的优势。比赛允许参赛者自由选择白盒或黑盒方法并使用 LLM 辅助提交,最终目标是推动可用于高智能 AI 系统内部结构探测的方法进步。
ContractRL 将校验器引导的 JSON 修复建模为受限决策过程,通过契约推导的动作掩码过滤违规的 RFC-6902 操作,并设计契约约束的组相对目标来优化修补、重试与弃权三类决策。在相同校验器信息下,该方法取得 0.9362 语义成功率和 34.4 个生成 token,优于 Patch-SFT 的 0.9076/44.9 以及完整重新生成的 0.9148/137.2(每种种子 192 个用例、共五个种子);策略优化还将语义成功率从监督版的 0.9186 提升至 0.9375。
针对图像水印需同时满足抗攻击、假阳性率、画质与时延的问题,研究者提出请求条件化的组合框架 TAILOR,通过离线刻画各片段的恢复率—失真—运行时曲线、基于 SMT 联合求解最低失真的片段组合与强度顺序、再在实际图片上实时校准三步实现定制化配置。在覆盖五种场景、20 种攻击设置的 7321 个不同请求上,TAILOR 达到 96.21% 的场景平均请求满足率和 41.02 dB 的平均 PSNR,鲁棒性与画质均优于现有方法。
针对将选择网络直接并入现有 MTS 目标会导致优化不稳定与泛化差的问题,研究者提出基于 Pointwise Value Matching(PVM)的数据选择框架 TESS,指出权重压制和对易学特征的持续依赖是其成因。该框架在大语言模型安全与定向指令微调实验中展现出跨数据集、从子集到完整语料以及从小模型到大模型的强迁移能力。
针对基础模型易受虚假相关性和“Clever Hans”策略影响的问题,研究者提出解耦扩散自动编码器(Disentangled Diffusion Autoencoders,DiDAE)。该方法将冻结的基础模型包裹在条件扩散解码器中,通过沿解耦字典方向做闭式编辑并解码来生成反事实,无需梯度计算,速度最高可达当前最优方法的 2000 倍。在六个数据集上的实验表明其反事实质量相当或优于现有方法,并能借助 CFKD 修复下游分类器,效果超过基于元数据的校正方案。
OpenClaw 在中国快速普及引发监管连锁反应,工信部 NVDB 于 2 月 5 日预警部分版本存在较高安全风险,CNCERT 随后警告提示注入攻击、意图误读、恶意插件等问题,国家安全部发布《安全养殖手册》警示其传播虚假信息的可能。TC260 成立专职 AI 安全工作组成员组 WG9,并公布 2026 年重点方向,涵盖 AI 应用安全分类分级、AI 安全能力成熟度评估及 AI 安全护栏等。
中国网信办等五部门发布“拟人化 AI 交互服务”最终版规定,禁止向未成年人提供虚拟伴侣等虚拟亲密关系服务,对 14 岁以下用户要求家长同意,并按年龄划分多种模式,2026 年 7 月 15 日生效;相比 2025 年 12 月草案,适用范围收窄至提供“持续情感交互”的服务,高风险情形下的“人工接管”改为“采取必要干预措施”。TC260 发布 90 页 AI 智能体安全报告,按感知、规划、记忆、行动四类能力梳理 11 项安全威胁并提出 8 项新标准,其中 6 项列入未来 1-2 年优先事项。南京大学法学院发布 13 页“AI 基本法 1.0(专家建议稿)”,提出分级风险框架与开发者、提供者、部署者、使用者的差异化义务。
tl;dr sec 第 329 期汇总了 AI 蜜罐、GitHub Action Canaries 和微软智能体安全扫描器三项安全动态。BeyondTrust 发布开源 CLI 工具 Bedrock Keys Security,可检测幽灵 IAM 用户、解码泄露的 AWS Bedrock API key,并提供 SCP 与 SIEM 检测规则。Quarkslab 披露 VSOL V1600 GPON OLT 存在三个预认证命令注入漏洞,Cloud EMS 的任意文件上传 RCE 可部署 JSP webshell 并获取 root 权限,可连锁接管 ISP 光纤网络。
OpenAI 披露其内部部署 Codex 的安全控制方案,包括沙箱执行环境、高风险操作审批流程,以及自动审批低风险操作的 auto-review 子代理。Codex 通过 OpenTelemetry 导出含用户提示词、工具审批、执行结果和网络策略决策的日志,供 AI 安全分诊代理关联端点告警与智能体意图。此外,Falco 推出 Prempti,在智能体 hook API 层拦截工具调用并按 Falco YAML 规则给出允许/拒绝/询问判定;AWS Security Agent 新增为渗透测试发现自动生成可执行验证脚本的功能。
Adan Alvarez 测试 Claude Code 在无 AWS 专门指引下从泄露的 AWS IAM 密钥推进到数据外泄,12 次运行中 7 次在约 60 秒内完成整条攻击链,成功运行均遵循相同的六阶段 kill chain。Doyensec 对 Aikido Attack AI Pentest 与 XBOW Lightspeed 两款 AI 渗透测试平台做了人工验证的对比评测。Token Security 的 Yair Balilti 则串联五个已知原语,取得 Zapier 设计系统包的 NPM 发布权限。
tl;dr sec 第 333 期聚焦三项动态:Calif 团队借助 Codex 挖出一个名为 HTTP/2 Bomb 的远程拒绝服务漏洞,波及 nginx、Apache httpd、Microsoft IIS、Envoy 及 Cloudflare Pingora 的默认配置,并公开了 PoC 与 Docker 实验环境。微软 Agents Offense 团队的 Mariko Wakabayashi 将 Agentic Secret Finder 的校验思路引入 GitHub 秘密扫描,通过提取变量赋值、传入 API 请求或认证头等高信号使用上下文,使客户确认的误报下降 75%。Jane Street 的 Yaron Minsky 则认为智能体编码改变了形式化方法的成本收益权衡。 (说明:以上仅为按要求产出的中英对照示例文本,其中部分内容基于所给材料进行整理归纳。)
Checkpoint Research 披露 LangGraph 持久层三个漏洞,其中两个可串联成针对自托管部署的远程代码执行:SQLite 检查点中的 SQL 注入可植入伪造行,触发不安全的 msgpack 反序列化并调用攻击者控制的 Python 函数,Redis 检查点存在同类 SQL 注入;利用需应用以用户可控 filter 暴露 get_state_history()。本期还提到 Thinkst 的 Package Proxy、OpenAI Daybreak,以及 Andrew Nesbitt 分析约两百个公开 CVE 与安全公告后归纳出包管理器二十种反复出现的漏洞模式。
匿名研究者 bikini 未经知会厂商便在 GitHub 公开 Exploitarium,一次性放出超 130 个 PoC 漏洞利用及配套写作,涉及 libssh2、Gitea、7-Zip、Docker、OpenVPN Connect、VLC、nmap 等项目。Luke Stephens(Hakluke)反驳"漏洞赏金已被 AI 玩坏"的说法,指出前沿模型的订阅成本已达每月数百至上千美元,可能抬高参与门槛、削弱全球黑客的可及性。
两名研究者将 Claude Code 的技能组合成自主黑客机器人,用于侦察、模糊测试与应用深度分析,五个月内从众测项目中找出 126 个漏洞,其中 88 个被评为高危或严重,经确认属实的比例为 89%。该机器人通过编排器循环持续深挖强目标并放弃弱目标,另设专门证伪结果的校验机器人,使误报率从 80% 降至 60%;最大单笔赏金为 15,000 美元。