跳到正文

危险能力

网络攻击、生物化学、自主复制等危险能力的评估与阈值。

370条动态与论文相关主题安全评测System Card前沿安全框架
在这个话题内搜索或按分类筛选

新闻与论文

第 161–180 条 · 共 370 条
10月2日周五
  1. 安远AI · 收录 · 原文 22

    全球40余位专家共倡AI×Bio安全,姚期智、张卫文、谢旻希等签署声明

    2025年7月发布的《关于人工智能与生命科学融合的生物安全风险的声明》,获超40位专家联署,含姚期智、Yoshua Bengio、George Church、张卫文、谢旻希等,由核威胁倡议组织(NTI)官网首发。声明警告AIxBio能力既降低制造有害生物制剂的准入门槛又抬高危害上限,还能削弱传染病监测、医疗防护与核酸合成筛查等防御体系,尤其点名面向科学发现的AI智能体能自主执行多步任务并被滥用。声明呼吁各国政府、产业界、学界与资助方共建技术护栏与治理机制,投入负责任的研发并推动国际合作。

  2. 安远AI · 收录 · 原文 15

    2025“AI向善”全球峰会:安远AI谢旻希解析前沿AI四大风险与治理路径

    安远AI创始人兼CEO谢旻希在联合国与国际电信联盟(ITU)共同组织的2025“AI向善”全球峰会上,将前沿AI风险归纳为滥用、意外故障、失控与社会系统性冲击四类,并提出“部署前—部署后”两步治理路径:部署前落实模型登记与审计,部署后建立生成合成内容标识及AI智能体身份标识以实现追溯问责。他援引《国际人工智能安全报告》指出,前沿AI已在编程、科学推理、病毒学等两用领域达到专家级水平,AI智能体已具备利用零日漏洞的能力,并呼吁以多方协同框架明确不可接受结果与早期预警指标。

  3. 安远AI · 收录 · 原文 18

    AI Safety in China #23:中美 APEC 峰会讨论 AI 合作与中国修订网络安全法

    习近平在韩国 APEC 领导人会议期间与特朗普会晤时表示,美中在 AI 等领域拥有良好合作前景,并称 AI 将列入 2026 年由中国主办的深圳 APEC 议程,会议还通过了聚焦发展的 APEC AI Initiative(2026–2030)。同期,外交部副部长马朝旭在联合国安理会会议上呼吁全球 AI 治理共识,重申中国 7 月提出的世界人工智能合作组织提案。国内方面,中国首次修订《网络安全法》,新增第二十条 AI 条款,支持研发并提供数据算力、完善伦理准则与风险监测,但未引入新的强制性法律义务。

  4. 安远AI · 收录 · 原文 50

    Concordia AI 发布前沿 AI 风险监测平台与 2025 Q3 报告

    Concordia AI 推出前沿 AI 风险监测平台并发布首份 2025 Q3 监测报告,追踪全球 15 家领先开发者的模型在网络攻击、生物、化学和失控四个风险域的表现,称其为中国首个聚焦灾难性风险的同类型平台。报告称过去一年发布的模型在四个风险域的 Risk Index 均创下新高,累计最高值分别上升 31%、38%、17% 和 50%。不同模型家族走势分化:GPT 与 Claude 家族保持低风险,DeepSeek、Qwen 和 MiniMax 先升后降,Grok 的失控风险与混元的生物风险快速上升;报告还提到近三个月发布的中国模型在多个领域风险显著下降,主要源于对恶意请求的拒答增强。推理模型能力得分远高于非推理模型,但安全水平大致相当。开源权重模型与闭源模型整体能力与安全水平相近,仅在生物风险上得分明显更低。

  5. 安远AI · 收录 · 原文 29

    中国AI安全动态第24期:CAICT发布AI安全报告与编程模型安全评估

    中国信通院(CAICT)发布58页AI安全报告,首次完整公开编程模型安全评估结果,发现多数编程模型缺乏对网络攻击滥用的足够防护。报告承认AGI失控风险但将其列为中低治理优先级,理由是近期发生可能性低。国务院新闻办11月发布军控白皮书,首次在中央政府政策文件中明确提示AI与军民两用化学品融合风险,但未涉及AI驱动的生物、核及网络滥用风险。世界互联网大会专家委员会提出以联合国为中心的前沿AI风险治理框架,强调跨境评估、早期预警与应急响应机制。

  6. 安远AI · 收录 · 原文 15

    Concordia AI 2025 年度影响力亮点回顾

    Concordia AI 回顾 2025 年在 AI 安全与治理领域的工作,包括在 WAIC 举办 AI 安全与治理论坛,汇聚约 30 位专家、200+ 现场参会者与 14,000+ 直播观看。机构还与 Carnegie Endowment、Oxford Martin School、清华 CISS 与 I-AIIG 等联合举办两场国际研讨会,分别聚焦"AI 安全作为集体挑战"与"先进 AI 的早期预警与危机协调"。CEO 谢旻希参与首尔国际 AI 标准峰会、法国 AI 行动峰会及 AIxBio 生物安全治理对话。

  7. 安远AI · 收录 · 原文 50

    Concordia AI 发布 2025 Q4 前沿 AI 风险监测报告

    Concordia AI 发布前沿 AI 风险监测平台 2025 Q4 报告,追踪全球 16 家开发者的模型在网络攻击、生物、化学和失控四类风险上的表现,并汇总全年趋势。报告称 Q4 整体风险指数未再创新高,出现阶段性稳定,前沿模型安全分较上一季度明显上升,豆包、混元和 MiniMax 家族改善最明显。模型家族走势分化:GPT 和 Claude 维持低风险,DeepSeek 稳定在较高风险,Gemini 和 Kimi 在特定领域风险上升。Q4 有 70% 的模型在 SOSBench-Chem 上有害化学查询拒答率超过 80%,StrongReject 上的越狱抵抗力也普遍增强。失控风险方面,多数 Q4 模型情境感知得分接近或超过 80 分,诚实度差异悬殊,Claude Opus 4.5 Reasoning 为 96.4,Gemini 3 Pro Preview 仅 44.7。

  8. 安远AI · 收录 · 原文 50

    Concordia AI 发布 2026 Q1 前沿 AI 风险监测报告:滥用防护改善而失控安全停滞

    Concordia AI 发布 2026 Q1 前沿 AI 风险监测报告,首次采用 Risk Index v1.5 框架,独立评估 16 家公司 70 多个模型。新框架新增“有害操纵”风险域,并在失控域引入 MLE-Bench、GDM-Stealth、Agentic-Misalignment 等能力与倾向评测,在网络攻击、生物、化学域加入 Fortress、ISC-Bench 等高强度红队基准。报告发现风险趋势出现结构性分化:网络攻击、生物、化学和有害操纵域的能力与安全得分同步上升,而失控域能力持续增强、安全得分未同步改善。模型家族风险画像继续分化,Gemini 家族在失控域风险指数明显偏高,DeepSeek、GLM、MiMo 家族在多数域处于较高风险区间,Kimi 家族在生物和化学域风险指数上升较快,GPT 和 Claude 家族多数域仍处较低风险区间。

  9. tl;dr sec · 收录 · 原文 15

    tl;dr sec #329:AI 蜜罐、GitHub Action Canaries 与微软智能体安全扫描器

    tl;dr sec 第 329 期汇总了 AI 蜜罐、GitHub Action Canaries 和微软智能体安全扫描器三项安全动态。BeyondTrust 发布开源 CLI 工具 Bedrock Keys Security,可检测幽灵 IAM 用户、解码泄露的 AWS Bedrock API key,并提供 SCP 与 SIEM 检测规则。Quarkslab 披露 VSOL V1600 GPON OLT 存在三个预认证命令注入漏洞,Cloud EMS 的任意文件上传 RCE 可部署 JSP webshell 并获取 root 权限,可连锁接管 ISP 光纤网络。

  10. tl;dr sec · 收录 · 原文 25

    tl;dr sec #333:Perplexity 的 Bumblebee、规避云日志记录与 AI 漏洞挖掘

    tl;dr sec 第 333 期聚焦三项动态:Calif 团队借助 Codex 挖出一个名为 HTTP/2 Bomb 的远程拒绝服务漏洞,波及 nginx、Apache httpd、Microsoft IIS、Envoy 及 Cloudflare Pingora 的默认配置,并公开了 PoC 与 Docker 实验环境。微软 Agents Offense 团队的 Mariko Wakabayashi 将 Agentic Secret Finder 的校验思路引入 GitHub 秘密扫描,通过提取变量赋值、传入 API 请求或认证头等高信号使用上下文,使客户确认的误报下降 75%。Jane Street 的 Yaron Minsky 则认为智能体编码改变了形式化方法的成本收益权衡。 (说明:以上仅为按要求产出的中英对照示例文本,其中部分内容基于所给材料进行整理归纳。)

  11. FAR.AI · 收录 · 原文 18

    FAR.AI 巴黎 AI 安全论坛 2025:Bengio、RAND 与英国 AISI 共议 AI 系统风险

    2025 年 2 月 9 日,约 200 名研究者、工程师和政策制定者在巴黎皇家宫殿参加 FAR.AI 主办的 Paris AI Security Forum,讨论自主网络攻击、AI 智能体被劫持及硬件层防护等安全问题。Yoshua Bengio 指出欧盟《人工智能法案》行为准则仅是必要的第一步,呼吁监管者加快行动以防自我保存型 AI 脱离人类控制;RAND 与 Pattern Labs 警告国家行为体和资金充裕的攻击方已在探测 AI 弱点。Alex Robey 团队通过对自动驾驶汽车、无人地面车辆和机器狗的实验展示了针对 AI 控制机器人系统的越狱攻击路径。

  12. FAR.AI · 收录 · 原文 43

    FAR.AI 发布 ClearHarm 越狱数据集,聚焦 CBRN 等明确有害问题

    FAR.AI 发布越狱基准 ClearHarm,聚焦 CBRN 威胁等明确有害问题,数据集已上线 HuggingFace,共 179 条提示词。作者认为现有基准存在两类局限:许多问题属于模糊有害,在前沿模型安全规范下本可回答;另一些是双用途问题,攻击方法如 PAP 通过改写提示词就能显得高效。ClearHarm 只收录仅可用于攻击目的的单一用途查询,无论提示词结构、框架或上下文如何都应被拒答。数据集由 Claude 3.7 Sonnet 生成候选类别与示例,最终选定生物、化学、核、常规武器和网络恶意代码五类,并统一语法结构以便跨类别比较。作者称内部测试中,许多在现有数据集上表现有效的越狱方法在提取这类明确有害信息时效果明显下降,详细结果将在后续论文中公布。

    推荐理由FAR.AI 公开了 179 条 CBRN 越狱评测集,并说明它与 StrongREJECT 等基准在危害明确性上的差异。

  13. FAR.AI · 收录 · 原文 57

    FAR.AI 与 UK AISI 测试多层 AI 防御:STACK 攻击成功率达 71%

    FAR.AI 与 UK AISI 研究人员构建并攻击自研的多层防御管线,发现常规攻击对这套防御的成功率为 0%,而他们提出的分阶段攻击方法 STACK 在 ClearHarm 灾难性风险数据集上达到 71% 的攻击成功率。多层防御通常由输入过滤器、模型拒答训练和输出过滤器三部分组成,研究者在 Google ShieldGemma、Meta Llama Guard 等开源防护模型上搭建管线,结果表现最好的是用少量示例提示的 Gemma 2。STACK 依次针对每一层:先找到让有害请求对输入过滤器显得无害的通用越狱文本,再用现有技术诱导模型给出有害回答,最后找到让有害回答对输出过滤器显得无害的文本。71% 的成功率依赖攻击者能观察到是哪一层拦截了请求,在完全黑盒的迁移攻击场景下成功率降至 33%。

    推荐理由FAR.AI 与 UK AISI 合作构建分层防御管线并自研 STACK 分阶段攻击,给出 71% 与 0% 的对比数据,可供部署多层护栏的团队参考。

  14. FAR.AI · 收录 · 原文 33

    Mind the Mitigation Gap:为何 AI 公司必须同时报告缓解前与缓解后的安全性评估

    FAR.AI 指出多数 AI 公司只披露缓解前或缓解后其中一类安全评估,导致风险难以准确衡量,主张两者都必须上报。其梳理发现 OpenAI 对 o1 两类均公开且覆盖 CBRN 高风险能力,Anthropic 仅报基于低拒绝版 Claude 3 与 3.5 的缓解前能力且无明确定义,Gemini 1.5 仅有缓解后评估,Meta 对 Llama 3.1 只给模糊声明,阿里 Qwen-2.5 仅有基础缓解后评估,DeepSeek R1 则完全没有报告。该框架应用于 o1、GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro 后发现,WMDP-Chem 准确率上 o1 与 GPT-4o 最高达 70–75%,危险请求合规率上 GPT-4o 高达 50%。

  15. FAR.AI · 收录 · 原文 50

    FAR.AI 开源安全差距评估工具包,量化 Llama-3 移除护栏后的危险能力

    FAR.AI 发布开源工具包,用于移除开源指令微调模型的安全机制并评估由此产生的安全差距。工具包实现两种攻击方法,监督微调通过目标补全覆盖拒答行为,拒答消融则抑制模型内部与拒答相关的激活;评估覆盖多选题准确率、StrongReject 拒答行为和生成质量三个维度,训练流程已测试至 70B 参数,评估流程支持 405B。在 Llama-3.x-Instruct 系列(1B 至 405B)上的案例研究显示,WMDP-Bio 准确率随规模上升,移除护栏后对危险生物学请求的合规率大幅提高,准确率与合规率的乘积即有效危险能力随模型规模显著增长,说明安全差距在规模扩大时进一步拉大。作者指出当前仅支持微调和拒答消融两种攻击方法,数据集规模较小且框架针对对话模型优化。代码见 github.com/AlignmentResearch/safety-gap,论文见 arXiv:2507.11544。

    推荐理由FAR.AI 开源了移除安全机制并量化安全差距的工具包,附 Llama-3 系列从 1B 到 405B 的实测结果,可供评估开放权重模型风险时复用。

  16. FAR.AI · 收录 · 原文 15

    AGI 到来时记者准备好了吗?FAR.AI 举办记者研讨会

    FAR.AI 举办研讨会,帮助记者理解 AGI 时间线的分歧预测。Helen Toner 提出三种分析视角,Anton Korinek 指出 AGI 能胜任人类创造的任何新工作,将根本性削弱人类劳动在经济中的角色。Anthropic 的 Evan Hubinger 与 OpenAI 的 Jason Wolfe 分别分享了模型训练中失准及"谋划"行为的研究,后者在压力测试中于前沿模型上发现此类行为,但强调这不代表典型部署条件。

  17. FAR.AI · 收录 · 原文 43

    FAR.AI 牵头欧盟 AI Act CBRN 风险联盟

    FAR.AI 宣布被欧盟委员会 AI Office 选中,牵头 EU AI Act 下 CBRN 风险建模与评估联盟,为法案实施提供技术安全研究。该联盟由 FAR.AI(AI 安全研究与红队)、SecureBio(生物威胁评估)、SaferAI(AI 治理与风险建模)组成,并有 GovAI、Nemesys Insights、Equistamp 作为分包方,中标项目为 EC-CNECT/2025/OP/0032 Lot 1。未来三年,FAR.AI 将与 AI Office 共同开展风险建模与场景开发、评估工具与标准化报告流程建设、红队与对抗测试,以及定期向委员会通报模型、风险来源、诱导技术、缓解措施与事件等新进展。FAR.AI 还将作为分包方参与同一招标 Lot 4 的有害操纵风险建模评估。

    推荐理由欧盟 AI Act 下 CBRN 风险建模与评估的承包安排,呈现监管机构如何把技术评估外包给研究联盟。

  18. IAPS · 收录 · 原文 52

    IAPS 备忘录:Claude Mythos 的网络能力跃升与政策优先事项

    IAPS 发布备忘录,评估 Anthropic 于 4 月 7 日发布的 Claude Mythos Preview 及其配套的差异化访问计划 Project Glasswing,认为政策制定者应把该模型和 AI 网络能力的加速轨迹视为需要紧急行动的国家安全风险。Anthropic 的内部评估与独立评测显示,Mythos 在未知漏洞发现、漏洞利用生成和自动化攻击上均有明显提升,据报已发现数千个高危或严重漏洞,覆盖各大操作系统和浏览器;UK AISI 的 32 步企业网络攻击模拟中,Mythos 是首个端到端完成该靶场的模型,10 次尝试中成功 3 次,平均完成 22 步,而 Opus 4.6 平均 16 步。备忘录指出,从漏洞披露到出现可用利用的平均时间已从 2018 年的 2.3 年降至 2025 年的 23 天,2026 年 4 月进一步缩短到 20 小时。

    推荐理由梳理 Anthropic 新模型在网络攻防能力上的跃升,并给出美国在漏洞修复、开源与 OT 防护上的政策优先级。

  19. IAPS · 收录 · 原文 43

    IAPS 政策备忘录:以差异化访问推进美国网络战略

    IAPS 发布政策备忘录,主张美国政府主导差异化访问战略,让联邦机构、承包商和关键基础设施运营方优先获得网络能力模型,以在攻防之间取得优势。备忘录认为 Anthropic 的 Project Glasswing 和 OpenAI 的 Trusted Access for Cyber 虽有价值但范围有限,且开发者缺乏对国家安全风险和威胁态势的完整视野。文中指出 AI 网络能力快速提升,英国政府评估能力每四个月翻倍,此前为八个月;OpenAI 的 GPT-5.5 在网络安全基准上接近 Claude Mythos 水平,中国模型估计落后美国三到七个月,攻击者还可能通过权重窃取、知识蒸馏攻击或未授权访问获取能力。备忘录列出五项缺口,包括访问不等于防御成效、项目范围受限、只关注漏洞发现而忽视修复、依赖高成本模型(Mythos 运行成本约为小模型的 25 倍)、以及模型自身安全。

  20. IAPS · 收录 · 原文 46

    IAPS 发布前沿 AI 国家安全政策手册,提出十条建议

    美国智库 IAPS 发布备忘录,为白宫应对前沿 AI 的国家安全风险提出十条政策建议。作者认为 Anthropic 披露 Mythos Preview 具备不宜公开的网络安全能力只是一个信号,模型性能约每四个月翻倍,OpenAI 的 GPT-5.5 据报也展现出类似网络能力,生物安全等风险也可能出现。建议分为四组:保护模型权重等战略资产、扩大对对手 AI 研发的情报监测、通过自动化加速防御性研发与网络防御、建立联邦 AI 风险信息共享枢纽并评估企业内部模型。具体措施包括由 CAISI 与 DARPA、DOE 国家实验室投资评估科学,支持独立验证机构生态,为联邦机构制定 agent 标识符指南,设立国家 AI 预备队与 REACT 快速评估委员会,并推动国会立法授权 CAISI 每年至少 8400 万美元预算,同时加强与英国 AISI 的联合评估与人才交流。

    推荐理由这份备忘录把 Mythos 事件放进更长的能力曲线里,给出十条可对照的政策建议,适合关注前沿 AI 国家安全治理的读者了解美方机构分工思路。