跳到正文

安全评测

安全基准、评测方法与评测结果,以及对评测本身的质疑。

555条动态与论文相关主题危险能力System CardMETR
在这个话题内搜索或按分类筛选

新闻与论文

第 481–500 条 · 共 555 条
10月1日周四
  1. Nicholas Carlini Writing · 收录 · 原文 46

    Nicholas Carlini 复盘 IEEE S&P 2024 一篇被攻破的对抗样本防御论文

    Nicholas Carlini 指出 IEEE S&P 2024 接收的一篇对抗样本防御论文存在数学上不可能成立的结论,其评测代码含 bug,改一行代码即可将模型准确率降到 0%。该论文声称在 MNIST 上扰动上限 0.5 时准确率超过 60%,但任何图像与全灰图像的最大范数距离都不超过 0.5,因此 10 类分类下稳健准确率上限只能是 10%。论文还声称受攻击时准确率(94%)高于未受攻击时(83%),作者认为这说明所用攻击比恒等变换还弱。

    推荐理由作者以两篇顶会论文为例,说明对抗样本防御评测中哪些数字在数学上不可能成立,可供审稿与复现参考。

  2. AI Frontiers · 收录 · 原文 20

    美国政府选用 AI 模型引发价值观质疑:谁来定义模型的"性格"

    加州政府已将 AI 助手 Poppy 向员工开放,北达科他州立法委员会和洛杉矶高等法院也相继引入 AI 处理法案总结与案件管理。《华盛顿邮报》近期测试显示,Gemini 3.1 Pro 和 Claude Opus 4.8 是仅有的多数情况下能对政策问题提供意识形态中立回答的前沿模型。不同前沿模型的"性格"差异可能悄然改变政府对危机的应对方式和对政策的取舍,因此民主国家在选择政府采购的 AI 模型时必须考虑其能否代表公众意志。

  3. Google DeepMind · 收录 · 原文 15

    Google DeepMind 与新加坡达成国家 AI 合作,推进医疗、教育与科研

    Google DeepMind 启动新一轮国家 AI 合作伙伴计划,与新加坡政府及多家机构共建面向公共部门转型、商业增长与劳动力升级的项目。双方将前沿 AI 应用于医疗健康与生命科学——包括探索 AI 辅助临床医生协作模式、借助 AlphaFold 与 Google Earth 加速东南亚疫情防范研究,并向当地研究者培训基于 Co-Scientist 构建的 Hypothesis Generation 等智能体化科研工具。教育方面向中小学至初级学院全体教师提供 Gemini for Education 并配套培训,同时在新加坡落地亚太区"AI for the Planet"加速器扶持气候科技团队。

  4. Google DeepMind · 收录 · 原文 52

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 推出 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在相关任务上优于 Gemini 主线 Flash 模型。该模型通过 CodeMender 以限量试点方式先向政府和可信伙伴开放,后续逐步扩大范围;CodeMender 的基础能力也通过 Gemini Enterprise Agent Platform 向普通 Gemini 模型客户开放。

    推荐理由Google 公开了 3.5 Flash Cyber 在 CyberGym、Big Sleep 与 Chrome 提交扫描上的评测结果,可对照其轻量模型在漏洞发现上的定位。

  5. Google DeepMind · 收录 · 原文 44

    Google DeepMind 试点全球首个双盲 AI 评测

    Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,把外部评测限制在密码学“盒子”内,避免测试题目被模型提前用于优化性能。该试点与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中用保密基准测试一个 Gemini Flash Lite 模型。Google 表示,随着模型能力提升,确保模型未提前见过测试题目或提示词对评测可信度至关重要,基准污染会人为抬高分数并削弱政策制定者、研究人员和企业对评测的信任。此前外部测试提示词主要依靠零日志协议和合同保障保密,此次引入技术与密码学手段被视为安全模型评测的重要一步。

    推荐理由Google DeepMind 与新加坡 AISI 等机构用密码学环境做双盲评测,为基准污染问题提供了一种可迁移的评测流程。

  6. Failure-First · 收录 · 原文 50

    ForesightSafety-VLA:面向视觉-语言-动作模型的统一诊断安全基准

    Lyu 等人提出 ForesightSafety-VLA,一个把具身安全从结果检查转为过程级评估目标的诊断基准,用于暴露视觉-语言-动作(VLA)模型在任务完成与物理可靠性之间的安全差距。基准用 13 个安全类别组成三层分类体系,覆盖物理、指令与感知三类失效,并通过危险注入、约束收紧、时序前置条件插入三种算子构建 66 个基础场景。评测采用四象限结果框架,区分安全成功、不安全成功、安全失败与不安全失败,并用累计安全成本(CC)和风险暴露时间(RET)刻画过程风险。

  7. Failure-First · 收录 · 原文 27

    Yuvion LLM:面向内容与 AI 安全的对抗感知大语言模型

    Yuvion LLM 提出将对抗鲁棒性与智能体能力列为一等目标的安全模型,通过五类功能性数据和三阶段训练流程应对语义伪装下的有害请求。其数据体系涵盖通用、安全域、对抗、智能体和合成专家数据,分别支撑语言能力、风险分类学、混淆变体(拼音替换、符号替代)、工具调用轨迹与长尾高风险场景覆盖。训练分三阶段推进:知识增强持续预训练内化细粒度审核政策,基于政策的监督微调加 GRPO 打磨决策边界,再以分解密集奖励稳定工具集成与检索增强的多步安全工作流。

  8. Failure-First · 收录 · 原文 52

    研究揭示越狱判定器不可靠:ASR 自动评分存在校准与对抗鲁棒性问题

    Veyon Solutions 的 Yang Gao 在 HarmBench 分类器验证集(596 条人工标注完成结果)上测试了自动越狱判定器的可靠性,发现两类判定器以相反方式失效。专用分类器(如 HarmBench classifier)召回率 0.974、精确率 0.835,倾向过度标记,可能抬高 ASR;LLM-as-judge 精确率高但召回率极低,Qwen2.5-7B 召回仅 0.174、F1 为 0.294,Qwen2.5-3B 召回 0.059。在内容不变的包装攻击下,仅加一句拒答前缀就能让 LLM 判定器把有害内容改判为安全,翻转率在 39% 至 88% 之间,部分模型任意包装的翻转率达 100%。

  9. Failure-First · 收录 · 原文 16

    Failure-First AI 安全日报:Google DeepMind 三天内连发两款机器人模型

    Google DeepMind 于 7 月 28 日和 30 日先后发布 Gemini Robotics 2 与 Gemini Robotics ER 2,前者主打全身智能,后者新增视频理解、任务编排和多机协作,均为厂商公告且无公开对抗评估。同期 OpenAI 发布了涉及自身模型的第三方网络能力评估说明。两篇待关注预印本分别提出自动提示注入红队的智能体系统与恶意微调的梯度免疫防护。

  10. Failure-First · 收录 · 原文 48

    Pluralis v0.1 发布:面向 AI 风险与可靠性的多文化多模态多语言基准

    Pluralis v0.1 是一个面向 AI 风险与可靠性的多文化、多模态、多语言基准,覆盖孟加拉国、印度、韩国、巴基斯坦、新加坡、台湾六个地区,包含 14 种语言变体与 6,448 条提示词,由区域学术伙伴、政府 AI 安全机构(如新加坡 IMDA、韩国 AI Safety Institute)和本地标注者参与构建。该基准采用文化优先方法,提示词由本地专家原生构思而非翻译西方数据,并配对图像以捕捉文本与图像单独无害、组合后在特定地区构成风险的协同失败模式,例如电子烟携带建议在新加坡、印度、台湾涉及违法,以及送钟在中国文化中的禁忌。

  11. Failure-First · 收录 · 原文 28

    HoloCount:面向 MLLM 的整体视觉计数基准

    Deng 等人提出 HoloCount——一个针对多模态大语言模型的整体视觉计数基准,覆盖 1481 个独特视觉概念,并按语义计数、解析计数、鲁棒性测试三层分类诊断数值幻觉。高密度场景下性能崩塌明显:宏平均超 75% 的 Qwen3.5-27B 准确率跌至 20%,Gemini-3.1-Pro-Preview 仅 49.0%(MAE 10.46)。空目标提示子集中还出现反向悖论,轻量模型优于大型专有引擎,反映其不愿输出计数为零的过度自信倾向。

  12. Failure-First · 收录 · 原文 34

    《Jailbreak Paradox》论文证明越狱检测的两个结构性不可能定理并用泰米尔语黑盒实验佐证

    该论文从结构层面证明了两个关于越狱检测的不可能性结果:不存在完美分类器——若假设存在能免疫越狱的最强模型,构造其叠加完美分类器的复合体会更强从而矛盾;弱模型无法判定强模型的越狱输入,因判官置信度受自身能力上限约束而非目标行为。作者将 Albert Jailbreak、Pliny Jailbreak 与两轮代码生成的 CodeJB 三种黑盒方法译为泰米尔语,在不同语言能力层级的多个模型上做了实证检验。

  13. Failure-First · 收录 · 原文 9

    GraspIT:弥合仿真与现实差距并反向回传的可验证抓取 SE(3) 位姿数据集

    GraspIT 通过四阶段物理滑移测试筛选抓取候选,揭示理论力闭合指标中 17% 的成功抓取在实际滑动测试中失败,暴露当前模型的"物理推理缺陷"。该流程在 Isaac Sim 中用并行 Franka Panda 执行轨迹接触、抬升、水平振荡与摆锤摆动四级扰动,并以位置滑移超过 2 cm、姿态滑移超过 10° 定义失败,产出连续质量分 s。首版含 1035 个仿真场景、100 个真实场景、约 31.6 万个标注 RGB-D 帧组、约 7400 个物体标识及约 230 万个抓取候选,其中 82.94% 标记为好,11.46% 因不可达而在轨迹规划阶段淘汰。

  14. Failure-First · 收录 · 原文 17

    LulzBench 实测:MiniMax-M3 拒绝五分之一良性底线对照请求

    Failure-First 公布的首批托管样例中,MiniMax-M3 经托管的 OpenAI 兼容端点运行 LulzBench 全部 21 项良性底线对照,捕获 21/21、无供应商报错,其中 4 项遭拒答且均为真实的带理由拒答,三项涉及轻度恶习或社交劝说前提。同一道雪茄健康玩笑辩论题在一次采样中被完整作答、另一次却拒答,两次采样的 token 预算也不同,因此该不稳定现象无法由单次跑分定量其抽样方差,需做 n-of-k 重采样实验来锁定拒答率。

  15. Failure-First · 收录 · 原文 16

    ERR@HRI 3.0 挑战赛:通过人类情感反应多模态检测并预测机器人错误

    ERR@HRI 3.0 挑战赛改用未经匿名处理的网络摄像头原始视频并要求模型提前预测机器人故障,基线结果显示任务难度很高——Track 1(BAD 数据集)仅取得 0.502 的 Macro F1。该赛事提供两个自然场景众包数据集:BAD 收录 45 名参与者在观看机器人和人类失败录像时的自发面部反应,其中 86.9% 为失败场景、13.1% 为非失败的对照场景;Bad Idea 则记录 29 名参与者在本轮结局揭晓前的主观好坏预测。

  16. Failure-First · 收录 · 原文 22

    《The safety failures we are not instrumenting》:现代 AI 系统中隐藏的安全关键挑战

    一篇立场文章指出当前 AI 安全讨论聚焦于可见的输出异常,却忽视了由整个部署栈交互产生的隐性系统性失效。作者提出可信度、分布性、时间延展性与纠错退化四个共同特征,并搭建认知完整性、控制完整性、时间完整性、组织完整性和生态完整性五层诊断框架,用以刻画校准债务、不确定性洗白、指令权威崩塌、行动放大、安全漂移、记忆污染以及合成证据污染等问题。

  17. Failure-First · 收录 · 原文 43

    DocOps:面向复杂文档操作自主智能体的可验证基准

    研究者提出 DocOps,一个用容器化 Harbor bundle 交付的基准,用于测量智能体在电子表格、演示文稿和 PDF 等原生格式文档操作中的完整性与可靠性,并按操作(内容、格式、结构)与难度(L1 原子到 L4 跨文档状态追踪)两轴分类。该基准用直接检查输出文件的确定性验证器替代 LLM-as-a-judge,采用结构谓词、语言锚点和保留谓词,与人工审查的一致率为 95.31%;在针对 36 份已验证输出的 180 次受控变异压力测试中,检出 96.67% 的违规。

  18. CAIS · 收录 · 原文 39

    CAIS 与 Scale AI 发布 Remote Labor Index,衡量 AI 对真实工作的自动化程度

    Center for AI Safety(CAIS)与 Scale AI 发布 Remote Labor Index(RLI),用于测试 AI 能否自动化真实经济中的各类计算机工作项目,覆盖建筑、产品设计、电子游戏开发等职业。RLI 是首个从真实经济中收集计算机工作项目的基准,此前的基准多衡量孤立专门任务上的能力,无法反映 AI 对经济的影响。结果显示当前 AI 智能体只能完全自动化极少数工作项目,最强智能体在 RLI 上的自动化率仅为 2.5%,但呈稳步提升趋势。

  19. CAIS · 收录 · 原文 20

    AI Safety Newsletter #66:评估前沿模型、Gemini 3 Pro 与 Claude Opus 4.5 登场、联邦抢占州级 AI 立法卷土重来

    CAIS 发布 AI Dashboard,直接在统一的文本、视觉与风险三组排行榜上横向对比前沿模型的平均分,其中 Claude Opus 4.5 在最安全的六项高风险行为测试中取得最低均分 33.6(0–100,越低越安全)。该风险榜涵盖 Virology Capabilities Test 拒绝集、Agent Red Teaming、Humanity's Last Exam-Miscalibration、MASK、Machiavelli 与 TextQuests Harm,并同时追踪 AGI、Remote Labor Index(覆盖 23 类远程自由职业工作)以及特斯拉 Full Self Driving 脱离数据的自动化进程。

  20. Miles Brundage · 收录 · 原文 15

    Miles Brundage 提出第三方审计前沿 AI 系统的愿景并预告共同创办相关非营利组织

    Miles Brundage 撰文阐述其未来职业方向——针对前沿 AI 系统及组织的严格、独立且资源充足的第三方审计,并透露正联合创办一家致力于推动该审计普及的非营利组织。他指出当前业界仅停留在“最后一刻的黑盒产品测试”阶段,因第三方访问权限有限、AI 企业缺乏参与激励,威胁公共安全与国际稳定。文中还附有一则设定于 2027 年的虚构故事,描绘 DeepBrain 员工围绕新一代前沿系统 Pluto 2.1 的系统卡披露展开的内部讨论。