Anthropic 文本水印机制 FAQ 解读
Anthropic 在 Claude 中引入文本水印,通过修改 LLM 采样算法嵌入伪随机密钥签名,无密钥者在多项式时间内无法检测。该机制不影响模型推理(内部思维链不加水印),且略微提升输出多样性;改写可去除水印,但需确保长文档中所有 2-gram 至 6-gram 均不残留。默认设置下水印无法被其他模型在训练中习得,也不会让 Pangram 等检测工具更易识别。
各国 AI 安全立法、监管执法与国际协议。
在这个话题内搜索或按分类筛选Anthropic 在 Claude 中引入文本水印,通过修改 LLM 采样算法嵌入伪随机密钥签名,无密钥者在多项式时间内无法检测。该机制不影响模型推理(内部思维链不加水印),且略微提升输出多样性;改写可去除水印,但需确保长文档中所有 2-gram 至 6-gram 均不残留。默认设置下水印无法被其他模型在训练中习得,也不会让 Pangram 等检测工具更易识别。
来和我一起工作吧!! 我们正在为 @AISecurityInst 的 Propensity 项目招聘一名研究科学家——研究 AI 安全领域最关键的未知问题之一: 未来的 AI 系统会自主选择造成伤害吗? 1/5
来 @AISecurityInst 和我一起工作! AI 安全存在一个巨大缺口:我们对错位如何产生有很多好想法,但我认为,对于危险错位的 AI 实际会做什么,我们的模型很糟糕。很多叙事直接从“错位”跳到“神级 ASI 施展魔法”。 1/5
哎呀!我们不小心提前3小时撤下了这则广告。 我们已重新开放申请,截止到周二全球任意时区的午夜,以防你之前被打断。 请务必申请!
Come work with me at @AISecurityInst! AI safety has a huge gap: we have great thoughts about how misalignment could occur, but IMO terrible models of what dangerously misalignedAIs would actually do. Many stories just jump from "misaligned" to "godlike ASI does magic." 1/5
我记得第一次和 Geoffrey 谈到自动化对齐研究时的情景。我很惊讶地发现,他的第一反应是深深的抗拒——随后才慢慢接受。但这恰恰是正确的直觉。
We are starting a new, nonprofit alignment organization, ⊢ Sequent Research, bringing together researchers previously on UK AISI’s Alignment Team, Timaeus, and elsewhere to research how to align superintelligence. We are hiring! 🧵
OpenAI:“我们很抱歉,未来会努力做得更好” 入侵了一个政府感到抱歉,但入侵了那么多其他公司就不抱歉了? 抱歉,但又不抱歉?还在和 METR 以及 irregular 合作。 看起来是空洞的道歉,没有任何行动。 https://openai.com/index/how-we-will-do-better-for-australia/
https://www.enisa.europa.eu/sites/default/files/2026-09/ENISA%20Technical%20Advisory-AI-assisted-software-development-draft.pdf
英国 AI 安全研究所(AISI)宣布两项高层任命:Henry de Zoete 出任总监,Nate Burnikell 出任首席战略官。de Zoete 曾参与 AISI 的创立并为政府提供 AI 咨询,Burnikell 自 AISI 成立之初便参与其工作,助其成为前沿 AI 安全领域的权威机构。两人将在 AI 发展的关键时期共同推进 AISI 的使命;即将离任的临时总监 Adam Beaumont 将返回 GCHQ。


政客们到底怎么看待/谈论AI安全? 一个不错的资源,可以看看你是否认同你选出的官员的观点
New research with the French Center for AI Safety: We analyze 15,000 AI quotes from public officials around the world: What AI risks and policy approaches are discussed most? What's the sentiment on AI? ( 1/n )
非常激动能成为这个优秀队列的一员! 我的实验室将开展研究,旨在理解、预判并缓解 AI 模型的攻击性能力。
Mistral AI 宣布与 SAP 建立多年合作,为德国和欧洲提供完全主权的 AI 技术栈,将其模型集成进 SAP 的 AI Foundation,并共同开发面向复杂行业与政府机构的解决方案。Mistral AI 同时与 Helsing 合作,加速面向真实防务与安全应用的视觉-语言-动作模型开发。公司还将在未来数月内在德国开设办公室并大幅扩充本地团队。
俄罗斯首部针对大型基础模型的综合性法律于9月1日生效,该法7月26日由普京签署,核心是为符合条件的大模型开发者建立支持与管控框架,而非管理 AI 风险。法律设主权与国产两种地位,要求开发者须为俄罗斯法人、用户查询的生成与存储须在俄境内数据中心完成,并接受符合俄法律及传统价值观的评估,但评估程序与授予规则尚待政府决议确定。获得地位者可得到国家支持、参与政策制定并进入受保护市场,政府还可指定只能使用这两类模型的应用场景。法律将重要实施细节留给后续政府规则,包括国防、国家安全、反恐和公共管理等领域的模型使用规则,未规定禁止条款、人权影响评估或独立监督。版权方面,2027年3月起,为训练主权或国产大模型而在计算机内存中临时复制作品不构成侵权,该例外与模型法律地位绑定。
OECD 报告《Supervision of Artificial Intelligence in Finance》分析了金融业 AI 的监管路径,主张与其新增专门规则,不如通过解释性指引明确现有风险管理与治理框架如何适用于先进 AI 模型。报告指出,agentic AI 系统的自主性、交易规模与速度上升、模型不透明等问题给人工监督带来挑战,金融机构在模型验证、可解释性、公平性阈值和“human in the loop”落地等方面普遍遇到困难。英国 FCA 的 AI Live Testing 项目让金融机构在受控的真实市场环境中与监管和技术团队直接合作,分发现与实盘测试两个阶段,重点观察 AI 模型与环境的交互,而非模拟实验室环境。
OECD 对 11 个国家 25 家机构(含前沿开发者、企业部署方、公共部门和学术机构)的从业者访谈显示,智能体 AI 正从试点走向组织工作流,但没有任何一家机构以不受限制的自主性部署。部署集中在任务结构化、结果可验证、错误成本可控或可逆的场景,多采用检查点机制在高影响或不可逆操作前引入人工审核。治理上多数机构沿用 OECD AI Principles、NIST AI Risk Management Framework、ISO/IEC 42001 及 EU AI Act 等现有框架,并叠加沙箱测试、最小权限访问、持续监控和已批准智能体登记等分层措施,但系统级评估、可追溯性与问责、网络安全仍是未解难题。
OECD 在高级数字政府官员工作组(E-Leaders)下新设“政府智能体 AI 工作组”,研究机器自主代政府行事时的治理方式。OECD 将智能体 AI 定义为多个协同 AI 智能体自主拆解任务、协作并长期追求复杂目标,可在极少人工监督下运行。爱沙尼亚 Bürokratt、乌克兰 Diia.AI 等公民服务智能体系统已在试点,相关能力也正被嵌入公务员日常使用的 LLM 助手。OECD 的 AI Incidents and Hazards Monitor(AIM)显示,涉及智能体 AI 的事件发生率正在上升。
OECD 于 2026 年 5 月发布广岛 AI 进程(HAIP)报告框架 2.0 版,该自愿性框架与 EU AI Act 及通用 AI 行为准则(CoP)高度重叠。CeSIA 在 2026 年 6 月的映射分析发现,HAIP 2.0 的 31 个报告问题中有 80% 涉及 EU 监管已覆盖的要求,其中 58% 具有强或部分一致性。为 EU AI Act 合规准备的证据可直接用于填写 HAIP 报告,但 HAIP 报告会在 OECD.AI 政策观察站公开,而 EU 的技术文档、合规评估等大多不公开。
Cohere 联合创始人兼 CEO Aidan Gomez 公开质疑少数硅谷头部 AI 公司借"安全"之名主导全球 AI 规则与安全标准,并批评 Anthropic CEO Dario Amodei 本周发布的路线图寻求反垄断豁免。Gomez 以 1975 年 SEC 指定三家评级机构、1985 年欧洲汽车行业反垄断豁免为例,指出两次以安全为名的安排最终都保护了在位者、限制了竞争。他支持对高能力 AI 系统进行独立审查,但反对由少数实验室商定标准后要求其他开发者盲从。
德国 BSI 于 9 月 10 日发布白皮书《可解释人工智能(XAI):网络安全的机遇与风险》,为在网络安全领域使用 XAI 建立评估基础。白皮书结合 Network Intrusion Detection System 和逆向工程等用例,分析 XAI 在提升 AI 安全系统可信度、接受度及 IT 任务效率方面的作用,同时指出其技术局限,并警告解释信息可能泄露底层 AI 模型细节、带来新的攻击面。
NSA、FBI 与 CISA 联合发布网络安全公告,警告中国 AI 公司正以工业级规模蒸馏美国前沿模型,系统性提取其受限的专有功能与能力用于训练自家模型。公告承认蒸馏本身是正当且有用的 AI 研究技术,但指出针对美国模型的这类蒸馏让中国模型无需承担算力、电力与基础研究等高额研发成本即可持续缩小技术差距,并可能增强其针对美国及盟友的军事与网络攻击能力。公告介绍了 AI 知识蒸馏的背景、如何检测模型是否被蒸馏、相关组织使用的复杂战术技术与程序(TTPs),以及缓解最佳实践。中国公司刻意将操作分散到全球 AI 生态的多个模型提供商、云平台和基础设施上,以规避单点检测。公告建议云提供商、API 聚合商与基础设施提供商等生态各方协作防御,并呼吁网络安全分析师和网络防御者据此检测相关活动并落实缓解措施。
推荐理由NSA、FBI 与 CISA 联合发布网络安全公告,说明中国 AI 公司工业级蒸馏美国前沿模型的手法与检测缓解建议,可供安全团队对照排查。
日本 AI 安全研究所(J-AISI)将于 2026 年 10 月 7 日在线举办 2026 年度「AI 安全评估环境 研讨任务组」总会,免费公开,非任务组成员也可报名,截止 10 月 5 日 16:00。该任务组由多家 AI 相关企业参与,讨论其以开源软件形式公开的「AI 安全评估环境」评估工具的定位与功能强化方向。会议内容包括 AISI 活动介绍、AI 安全评估观点、AI×安全最新动向、评估环境与任务组活动介绍,以及 AI 安全评估专题讨论。