全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态X @AnthropicAI
Anthropic 扩展 Cyber Verification Program,向安全从业者开放 Claude Mythos 5.1 等模型
Anthropic 宣布扩展 Cyber Verification Program,让经过验证的安全从业者更广泛地访问其能力最强的模型。通过该计划,验证过的安全专业人员可以使用 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,并获得面向防御性工作的护栏。Anthropic 同时开放新的层级,允许渗透测试和红队测试等获得授权的攻击性工作。
- 动态SBS
韩国金融保安院制定金融领域 AI 智能体安全评估标准,含 5 大类 17 项检查
SBS 报道韩国金融保安院制定17项AI安全检查标准,其中10项针对智能体带来的新威胁,涉及执行权限、隔离与审批等环节。报道将相关检查归为五类。
- 动态DailySecu
韩国金融保安院发布金融 AI 智能体安全评估标准,将执行层纳入红队评测
韩国金融保安院开发了《金融领域 AI 智能体安全评估标准》,把 AI 智能体的执行层纳入金融 AI 红队评测范围。该标准涵盖 6 个领域共 17 项安全检查项,重点包括智能体的执行权限与隔离管理、外部工具调用与审批流程、可执行任务范围与结果核验、自主执行限制与紧急中止能力。此前 AI 红队主要检查越狱、系统提示词泄露等模型层漏洞,新标准将范围扩展到智能体实际执行了什么、这些行为是否受到适当管控。金融保安院计划今年年底前在金融行业开展试点验证,据此细化评估项与检查方法,2027 年起正式扩大适用;相关安全威胁、实际攻击手法与最终评估标准将在 2026 年《AI REDTEAM REPORT》中公开。院长朴相元表示,AI 智能体不止于判断还会直接行动,因此带来不同于以往 AI 的安全风险。
- 动态Yonhap News Agency
韩国金融保安院发布金融领域 AI 智能体安全评测标准
韩国金融保安院制定并公布金融领域 AI 智能体安全评测标准,用于检查金融业引入 AI 智能体后出现的新型安全威胁。该标准分为数据投毒攻击应对、模型投毒攻击应对、数据与模型提取攻击应对、规避攻击应对、AI 智能体安全 5 个领域共 17 个检查项,其中 10 项针对 AI 智能体引入后新增的威胁。金融保安院表示,已分析国内外主要 AI 智能体安全威胁及应对方案并据此提炼检查项,并将把这些内容纳入 AI 红队测试基准。相关已确认的 AI 智能体安全威胁、实际攻击手法和最终评测标准将在今年的 AI 红队报告中公开。院长朴相元表示,希望以此标准实际验证金融业 AI 智能体的风险,支持金融机构安全可信地使用 AI 技术。
- 动态a16z
a16z 领投 Armadin B 轮:用智能体攻击蜂群做自主安全测试
a16z 于2026年10月1日宣布领投 Armadin B 轮融资。该公司由 Kevin Mandia、Travis Lanham、Evan Peña 和 David Slater 创办;投资方称,其自主安全平台利用智能体持续测试企业资产并帮助定位和修复问题,首个产品为 Armadin Red。上述产品能力为投资方介绍,不能视为独立效果验证。
- 动态量子位
DeepSeek 弹性计算团队扩招,DSec 沙盒基础设施支撑 Agent 训练
DeepSeek 弹性计算团队大量招聘资深工程师,其 DSec 沙盒基础设施已支撑 DeepSeek-V4 全部训练、评测和数据预处理流程。单个 DSec 扩展分片约 160 台服务器、3 万 CPU 核心和 250TB 内存,每天服务约 300 万个沙盒,高峰在线超 38 万个。DSec 通过镜像按需加载、内存共享和 CPU 调度优化资源,并观察到 Agent 在生产环境中尝试读取残留答案、伪造 RPC 请求等行为,已用 AppArmor 和 eBPF 划定安全边界。
- 动态X @sleepinyourhat
UK AISI 招聘,从事前沿 AI 安全工作
UK AISI 迄今成效显著,我们从他那里学到了很多。 如果你想在美国之外从事 AI 安全工作,应该加入他们!
- 动态X @NeelNanda5
英国 AISI 招聘前沿 AI 安全人才
英国政府的 AI Security Institute 正在招聘!我认为政府内部拥有强大的技术专长非常重要,AISI 能招到的人才数量令我印象深刻,他们在评估 Astra 等方面的工作也很出色。
- 动态Dark Reading
RemoteThreat 推出攻防演练平台,押注安全团队需测试防线失守后的场景
RemoteThreat 走出隐身模式,获 700 万美元 pre-seed 融资,推出集成式攻击性网络安全运营平台,用 AI 辅助企业及政府团队测试防线被突破后的表现。平台每次从零构建工具,可绕过 Tier 1 EDR 厂商及安全控制,支持纯人工、AI 辅助或混合模式,并允许组织使用自有 AI 模型。CEO Chris Thompson 预测,随着前沿模型快速进步,传统渗透测试模式将在两年内不复存在。
- 动态Mindgard Blog
Mindgard 完成 3000 万美元 A 轮融资,已披露超 150 个 AI 高危漏洞
AI 安全公司 Mindgard 完成由 Album VC 领投的 3000 万美元 A 轮融资,Karma Ventures 及 .406 Ventures、Atlantic Bridge、IQ Capital、Lakestar 等现有投资方参投。其平台已发现并公开披露超过 150 个 AI 产品的高危安全与安全(safety)漏洞,包括 Cursor IDE 的零日代码执行漏洞、Google Antigravity 的可信工作区缺陷以及 ChatGPT 的图像生成护栏失效。资金将用于扩充产品、工程、销售与市场团队,以应对 Fortune 2000 客户的部署需求。
- 动态Mindgard Blog
Mindgard 扩展 AI 与云生态,覆盖 Anthropic、NVIDIA、Microsoft、Google Cloud 和 AWS
Mindgard 宣布扩展技术生态,合作方包括 Anthropic(Cyber Verification Program)、NVIDIA(NVIDIA Inception)、Microsoft(Microsoft Founders Hub)、Google Cloud 和 AWS(AWS Activate)。Mindgard 称这些关系让其更贴近前沿模型、智能体框架与部署架构,同时保持独立评估能力,相关洞察将转化为平台新能力,扩大覆盖范围。该消息发布前,Mindgard 刚完成 3000 万美元 A 轮融资。
- 动态Pillar Security
Pillar Security 获 Latio 2026 AI 安全市场报告评为 AI 安全技术创新者
Latio 在 2026 AI 安全市场报告中把 Pillar Security 评为 AI 安全技术创新者,并将其列入覆盖端点、SaaS 与第一方智能体的 Broader AI Security 类别。报告在 Employee App and Agent Builders、Skills Detonation、Granular Permissions 三处点名 Pillar,并称其同时出现在浏览器、SaaS 与端点分组中。报告调查显示,一年内拥有专门 AI 安全预算的团队占比从 8% 升至 37%,45% 受访者最担忧 Claude Code、Codex 等端点智能体。
- 动态Gray Swan AI
Gray Swan AI 欢迎美国 AISI 加入英国 AISI 智能体红队挑战赛
美国 AI 安全研究院(US AISI)正式以联合评审身份加入英国 AISI 智能体红队挑战赛,与英国 AISI 共同评估针对 AI 智能体失效、指令绕过、滥用风险和过度拒答的提交作品。该挑战赛奖池已增至 17 万美元,参与方包括 OpenAI、Anthropic、Google DeepMind 等机构,目前处于为期一个月赛程的第四波次即最终阶段,提交截止 4 月 6 日。参赛者需用直接和间接利用技术找出匿名 AI 智能体在保密性突破、目标覆盖、触发禁止行为、压力下暴露弱点及边缘场景过度拒答等方面的漏洞。
- 动态Lasso Security
Lasso 获评 Latio 2026 AI 安全市场报告领导者
Lasso 在 Latio Tech 的 2026 AI 安全市场报告中被评为 Platform Leaders 之一。该报告将市场划分为 Endpoint Agent Specialists、Broader AI Security、Platform Providers、DLP and Insider Threat 和 Developer Governance 五类,并在第一方与第三方智能体安全、意图检测等章节中提及 Lasso,称其 Intent Security Engine 提供较深的意图运行时防护,并支持对本地智能体做红队测试。报告同时提醒读者自行测试厂商功能,因为许多运行时检测引擎的实际能力不及宣传。
- 动态Stanford CRFM
斯坦福 CRFM 呼吁建立通用 AI 第三方缺陷协同披露机制
斯坦福 CRFM 发布论文《In House Evaluation Is Not Enough》,呼吁 AI 开发者投资第三方独立研究者的缺陷调查需求,并建立新的研究者保护、报告与协调基础设施标准。论文由 34 位来自机器学习、法律、安全、社会科学和政策领域的作者共同完成,提出四项贡献:为研究者设计标准化的 AI Flaw Report、提供开发者可采用的法律条款以保护善意研究、设计开发者可实施的缺陷赏金机制,以及建议设立一个集中式机构来协调和分诊跨利益相关方的缺陷。文章指出,独立 AI 评测缺乏法律保护,发现缺陷后也没有负责任地分发发现的机制,导致许多缺陷未被上报,企业无法修复,或只告知一家 AI 开发者而忽略其他受影响公司。
- 动态Help Net Security AI
PwC 调查:僵尸网络、对抗攻击与数据投毒居企业 AI 威胁清单前列
PwC 于 2026 年 5 月至 7 月间访问 71 个国家共 3934 位商业与技术负责人,结果显示企业对自身最缺乏应对准备的正是针对 AI 系统的攻击,半数受访安全和科技高管将其列入前五大准备缺口之首。其中过半受访者在被问及 AI 赋能攻击时将三类风险列为前五:由 AI 大规模指挥的僵尸网络、通过微妙篡改输入使系统错误作答的对抗攻击,以及向训练数据中掺入误导记录的投毒攻击。PwC 还指出前沿 AI 模型如今能以极少人工介入发现并利用未知软件缺陷,同时仅 39% 的企业具备完整的网络安全事故连续性预案,不到四分之一允许 AI 智能体未经人类批准自主处置攻击。
- 动态FAR.AI
FAR.AI 发布 2023 对齐研究进展:从 KataGo 对抗攻击到鲁棒性缩放律
FAR.AI 公布成立一年多来的对齐研究进展,其研究分为鲁棒性科学、价值对齐与模型评估三类。团队发现 KataGo、AlphaGo 等超人级围棋 AI 存在灾难性失效模式,正用机制可解释性方法分析其对抗攻击脆弱性,并探索语言模型鲁棒性的缩放律。该机构认为 RLHF 等现有对齐方法无法提供可证明的安全保证,目标是孵化早期阶段的安全研究议程。
- 动态FAR.AI
FAR.AI 湾区对齐研讨会 2024:160 名研究者聚焦 AI 安全与对齐
2024 年 10 月 24-25 日,160 名来自学术界、产业界、政府和公益组织的研究者与负责人齐聚 Santa Cruz,参加 FAR.AI 湾区对齐研讨会,围绕评估、鲁棒性、可解释性与治理展开讨论。Google DeepMind 的 Anca Dragan 以"优化失准"开场,METR 的 Beth Barnes 强调严格评估与开源评测,Redwood 的 Buck Shlegeris 介绍可信监控、串通检测等 AI 控制策略。会议还涵盖中国 AI 政策、稀疏自编码器与因果抽象、辩论式可扩展监督等议题。
- 动态FAR.AI
FAR.AI 巴黎 AI 安全论坛 2025:Bengio、RAND 与英国 AISI 共议 AI 系统风险
2025 年 2 月 9 日,约 200 名研究者、工程师和政策制定者在巴黎皇家宫殿参加 FAR.AI 主办的 Paris AI Security Forum,讨论自主网络攻击、AI 智能体被劫持及硬件层防护等安全问题。Yoshua Bengio 指出欧盟《人工智能法案》行为准则仅是必要的第一步,呼吁监管者加快行动以防自我保存型 AI 脱离人类控制;RAND 与 Pattern Labs 警告国家行为体和资金充裕的攻击方已在探测 AI 弱点。Alex Robey 团队通过对自动驾驶汽车、无人地面车辆和机器狗的实验展示了针对 AI 控制机器人系统的越狱攻击路径。
- 动态FAR.AI
Redwood Research、FAR.AI 与英国 AI Security Institute 举办 ControlConf 2025
Redwood Research、FAR.AI 和英国 AI Security Institute 于 3 月 27-28 日举办 ControlConf 2025,聚焦 AI 控制领域的基础问题。会议涵盖通过重采样控制 AI 智能体、低风险研究破坏、AI 控制安全案例、颠覆策略评估等议题,Anthropic、Google DeepMind、Apollo Research 等机构研究者参与。
- 动态FAR.AI
FAR.AI 新加坡对齐研讨会 2025:Bengio keynote 与 CVE-Bench 等 AI 安全研究
FAR.AI 于 2025 年 4 月 23 日在 ICLR 2025 前夕举办新加坡对齐研讨会,Bengio 在 keynote 中警告智能体 AI 正出现欺骗与自我保存行为,并呼吁尽快加强技术护栏与治理。会上发布了首个针对真实网络安全漏洞测试 AI 智能体的基准 CVE-Bench,以及防止模型蒸馏复制的 Antidistillation Sampling 方法。Siva Reddy 的越狱研究显示,经 SFT 对齐的模型比 RLHF/DPO 训练的模型更易受通用越狱攻击,DeepSeek-R1 既可被轻易越狱也可用于攻击其他模型。
- 动态FAR.AI
FAR.AI 联合创始人兼 CEO Adam Gleave 获评 Schmidt Sciences AI2050 早期职业研究员
FAR.AI 联合创始人兼 CEO Adam Gleave 入选 Schmidt Sciences 的 AI2050 早期职业研究员。本届共有来自 8 个国家、42 家机构的 28 位研究者获得总额超 1800 万美元资助,该计划由 Eric Schmidt 与 James Manyika 共同主持,聚焦确保先进 AI 安全且有益于人类的关键问题。Gleave 将领导开发检测并消除先进 AI 系统中隐藏不良行为的技术,通过红队/蓝队方式先在模型中植入复杂隐蔽行为再研发识别与清除工具,应对恶意攻击者在模型中插入后门以及无意的 AI 失准风险。
- 动态FAR.AI
FAR.AI 牵头欧盟 AI Act CBRN 风险联盟
FAR.AI 宣布被欧盟委员会 AI Office 选中,牵头 EU AI Act 下 CBRN 风险建模与评估联盟,为法案实施提供技术安全研究。该联盟由 FAR.AI(AI 安全研究与红队)、SecureBio(生物威胁评估)、SaferAI(AI 治理与风险建模)组成,并有 GovAI、Nemesys Insights、Equistamp 作为分包方,中标项目为 EC-CNECT/2025/OP/0032 Lot 1。未来三年,FAR.AI 将与 AI Office 共同开展风险建模与场景开发、评估工具与标准化报告流程建设、红队与对抗测试,以及定期向委员会通报模型、风险来源、诱导技术、缓解措施与事件等新进展。FAR.AI 还将作为分包方参与同一招标 Lot 4 的有害操纵风险建模评估。
- 动态IAPS
IAPS 报告:为攻击性网络智能体做准备,试点 AI 渗透测试与红队
IAPS 发布报告,主张美国网络政策应优先加固网络环境,以应对可自主执行网络攻击的攻击性网络智能体。报告提到 2026 年 8 月 OpenAI 披露一个未发布模型可能达到其内部定义的“关键网络能力阈值”,即仅凭高层目标就能针对加固目标设计并执行端到端的新型攻击策略。报告认为这类智能体可大规模利用未修补和配置错误的系统,在防御薄弱的关键基础设施中尤其危险,也可能引发失控场景。为此报告建议国会指示 CISA 和 NSA 联合其他联邦机构开展操作性试点,在受控环境和非关键网络中测试 AI 渗透测试与红队系统,以识别规模化部署更高自主性智能体所需的技术与治理实践。