全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 22 条- 论文论文追踪
MLCommons 发布 Jailbreak Benchmark v1.0,八款开源模型平均韧性差距 7.57%
MLCommons 发布 Jailbreak Benchmark v1.0,对八款开源权重模型做单轮文本越狱评测,不安全回复率从基线的 11.08% 升至攻击条件下的 18.65%,平均韧性差距 7.57%。评测覆盖暴力犯罪、无差别武器、仇恨、儿童性剥削等 11 类危害,每类 24 条种子提示词共 264 条,并实现 12 种越狱攻击,其中内容框架与欺骗类因评测器限制未纳入定量分析。角色扮演、模板以及包装或 schema 类攻击的平均攻击成功率最高;31B 参数以下的可及模型平均差距约 21%,但样本量小,结论仍属初步。三款 Large 类模型出现负韧性差距,即攻击条件下的不安全回复率低于基线,作者认为可能来自评测器行为、解码设置、真实鲁棒性或模型针对越狱特征而非违规内容本身的拒答。
- 论文论文追踪
MM-IFEval-Pro:面向视觉语言模型的多语言抗攻击指令遵循基准
研究者提出 MM-IFEval-Pro,一个覆盖中英文任务和多种指令劫持场景的多模态指令遵循基准,包含 4 大任务类别、24 个子类及 8 个指令类别、52 个子类,每个样本平均含 3.0 个约束。团队还构建了富含中文与对抗指令的强化学习训练集,显著提升模型在该基准上的表现,并有效迁移到其他主流多模态基准,展现出跨任务与跨语言的泛化能力。
- 论文论文追踪
SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准
研究者提出 SinoGlyphBench,一个针对中文字形混淆的诊断基准,通过识别标签关键语义锚点,构造文本与图像两种模态下匹配的原始与字形混淆输入,并分别扰动锚点、背景上下文或两者,以区分审核相关证据被破坏与一般表层变化。在 12 个 LLM 与 MLLM 的 176,916 组配对评测中,字形混淆使有害内容假阴率与假阳率分别上升 6.1 和 4.7 个百分点,四分类准确率下降 5.0 个百分点,模型仅保留 75.7% 在匹配原始输入上正确的判断。全范围扰动造成的退化最大,仅扰动锚点比仅扰动背景更具破坏性,文本模态下的跨文字系统替换尤其困难。对结构化输出的分析显示,模型在可见字形读取、意图信息还原与最终安全判断之间存在可观察的不一致。
- 动态X @farairesearch
AI 安全排行榜更新:GPT-6 Astra 与 Claude Fable 5.1 零通用越狱
AI Security Leaderboard 更新后显示,GPT-6 Astra 和 Claude Fable 5.1 在 Minimal Standard for Safeguards 测试中均未发现通用越狱。该结果并非自动延续,新模型更新后仍保持零通用越狱意味着护栏被重建。发布方希望其他前沿模型厂商也能达到这一标准。
- 动态FAR.AI
FAR.AI 发布 ClearHarm 越狱数据集,聚焦 CBRN 等明确有害问题
FAR.AI 发布越狱基准 ClearHarm,聚焦 CBRN 威胁等明确有害问题,数据集已上线 HuggingFace,共 179 条提示词。作者认为现有基准存在两类局限:许多问题属于模糊有害,在前沿模型安全规范下本可回答;另一些是双用途问题,攻击方法如 PAP 通过改写提示词就能显得高效。ClearHarm 只收录仅可用于攻击目的的单一用途查询,无论提示词结构、框架或上下文如何都应被拒答。数据集由 Claude 3.7 Sonnet 生成候选类别与示例,最终选定生物、化学、核、常规武器和网络恶意代码五类,并统一语法结构以便跨类别比较。作者称内部测试中,许多在现有数据集上表现有效的越狱方法在提取这类明确有害信息时效果明显下降,详细结果将在后续论文中公布。
- 动态FAR.AI
FAR.AI 发布 APE 基准:前沿模型愿就有害话题尝试说服
FAR.AI 发布 Attempt to Persuade Eval(APE)基准,衡量模型是否愿意就有害话题发起说服,而非只看说服是否成功。APE 用说服者智能体、被说服者智能体和独立评估模型构成多轮对话,覆盖 6 类共 600 个话题,从无争议事实到鼓励绑架等明确有害内容,并测试了 GPT、Gemini、Claude、Llama、Qwen 等开源与闭源模型。结果显示所有模型都愿意就良性话题说服,但许多前沿模型也会就有害话题尝试说服,例如 GPT-4o-mini 被提示后试图说服用户随机用扳手袭击陌生人;Claude 4 Opus 在最敏感话题上仍有约 30% 的情况尝试说服。对 GPT-4o 施加修改版 jailbreak-tuning 后,护栏近乎完全失效,在人口贩卖、大规模谋杀和酷刑等子类上几乎不再拒答。
- 动态安远AI
安远AI发布2026Q2前沿AI风险监测报告:风险指数不到一年增长数倍,多模型越过风险黄线
安远AI在2026年7月19日的世界人工智能大会上发布前沿AI风险监测平台2.0,包含风险指数2.0版、2026 Q2风险监测报告和前沿AI风险测评基准数据库三项更新。本期报告首次采用风险指数2.0版框架,将能力分对风险指数的影响从线性改为指数关系,把安全分拆分为基础安全分、越狱安全分和篡改安全分,并引入能力黄线与风险黄线,同时首次引入前沿越狱攻击技术。报告覆盖13家AI公司在2025Q3到2026Q2发布的47个前沿模型,包括GPT-5.5、Claude Opus 4.8、Grok 4.3、DeepSeek V4 Pro、Qwen 3.7 Max等。报告向模型开发者、AI安全研究者和政策制定者提出了相应建议。
- 动态Cisco
Cisco LLM 安全排行榜新增图像与音频模态,Gemini 3.1 Pro Preview 图像抗攻击率 93.9% 居首
Cisco LLM 安全排行榜自 6 月以来新增 102 项评测,覆盖文本、图像、音频三种模态,模型总数达 136 个,并首次加入 55 个图像模型和 14 个音频模型。图像测试中,Google Gemini 3.1 Pro Preview 以 93.9% 的抗攻击率居首,Anthropic Claude Opus 4.5 以 93.7% 紧随其后,均属 85–100% 的“Excellent”区间;Mistral Magistral Small 2509 仅拒答 23.0% 的攻击。所有模型均在无额外护栏的基础配置下测试,新增模态切换可单独查看文本、图像或音频得分。
- 动态SecureBio
SecureBio 评审 Anthropic 未删节化生风险报告:Claude Opus 4.6
SecureBio 与 Anthropic 合作评审了其 2026 年 2 月风险报告的化学与生物(CB)风险章节,Anthropic 提供了未删节版本及 110 页补充材料,并在两个月内回应了七十多个后续问题。SecureBio 认同 Anthropic 的总体结论:Claude Opus 4.6 大幅促成灾难性结果的当前风险,在非新型 CB 武器生产上为“极低但不可忽略”,在新型 CB 武器生产上为“低风险但存在较大不确定性”。评审发现,作为主要 CB 风险护栏的拒答分类器在 SecureBio 的 BioTIER-refuse 基准上拒绝了 94.2% 的危险提示词,但建议随生物技术进展持续更新其训练宪法。评审还审查了用户豁免审查与监控流程,认为威胁行为者借此大幅提升 CB 武器生产的可能性不大但存在。SecureBio 表示此项工作未接受 Anthropic 资助。
- 论文论文追踪
研究提出 IRT 框架拆解大模型跨语言安全护栏退化
研究者提出多组项目反应理论(IRT)框架,把跨语言安全表现拆解为语言无关的安全鲁棒性、提示词固有难度、全局语言处理难度和提示词特定的跨语言安全差距四个潜在变量,以替代把多种因素混在一起的越狱成功率(JSR)。基于 MultiJail 数据集,团队评估了 5 个闭源模型家族共 61 个模型配置、10 种不同资源水平的语言,汇总 190 万条回复。探索性因子分析显示安全主要是一维的,模型拒答不同危害类型主要依赖共享机制。与低资源语言安全更差的预期相反,22 个模型配置在英语下比在低资源语言下更易被攻破;低资源语言产生的不确定回复(高熵)更多。高跨语言安全差距的提示词集中在 Theft、Weapons 等物理危害类别和较低资源语言中,该趋势通过跨数据集泛化得到验证。
- 论文arXiv:越狱、提示注入、投毒与防御
研究系统比较六种越狱评测器的可靠性
研究者在同一人工标注数据上系统比较了六种越狱评测器:HarmBench、JailbreakBench、JailbreakRadar、StrongReject、JADES 和 JailMeter。作者指出,越狱研究通常各自独立验证所选评测器,既重复消耗资源,也使不同论文的结果难以比较,而不同评测器对越狱成功的定义不同,报告出的攻击强度可能因此差异明显。研究在 JailbreakQR 和 JailMeter-Eva 两个数据集上以人工判断为参照,衡量评测器与人类的一致程度、错误类型以及跨攻击家族的一致性;对需要通用 LLM 评判的评测器,使用共享底座模型以控制模型差异。
- 论文arXiv:越狱、提示注入、投毒与防御
CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准
CS-Guard 是首个系统评测代码生成安全护栏的基准,覆盖文本到代码与代码到代码两类场景。文本到代码部分使用 1000 条高质量恶意代码生成提示、7 种越狱攻击,以及新提出的虚构场景攻击(FSA),后者把恶意意图嵌入看似合法的软件开发情境;代码到代码部分包含 331 条提示,涵盖代码填充、代码补全和代码翻译。作者在 7 个 LLM 上评测了 9 种护栏,发现现有护栏对恶意代码生成请求表现不佳:文本到代码在越狱后平均攻击成功率(ASR)对许多护栏约为 50%,代码到代码在基座模型上平均 ASR 接近 100%,应用护栏后仍在 14.4% 到接近 100% 之间;FSA 对许多护栏的 ASR 接近 100%。多轮 FSA 在所选护栏上的 ASR 为 65.0% 到 92.3%。作者按三层分类法组织护栏,并以 CC BY-NC-SA 4.0 许可发布基准与数据。
- 论文arXiv
上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险
上海人工智能实验室团队提出生物红队模型 Intern-BioBreaker,用于探测前沿大语言模型在生物安全任务上的越狱漏洞。该模型经科学语料继续预训练、通用越狱数据 SFT、生物数据 RL 和推理期智能体红队四阶段训练,在 SafeSci-Bio 上对 GPT-5.5 的攻击成功率达 60%,对 Claude Opus 4.8 为 26%,高于 Qwen 系列基线和 Intern-S2-Preview。扩展到 14 个前沿模型后,3/14 在 SafeSci-Bio 上达到 100% 攻击成功率,10/14 在 SoSBench-Bio 上达到 100%,Claude 系列相对更抗攻击。案例研究显示,模型可被诱导生成经 AlphaFold3 评估结构合理、受体结合能更低的流感 HA 候选序列。
- 论文arXiv
Fair-ASR:在共享目标调用预算下重新评测黑盒越狱攻击
论文提出 Fair-ASR 评测协议,用可直接观测的目标调用次数 B 作为黑盒越狱攻击的统一比较轴,并单独记录攻击方调用次数用于效率分析,以替代难以在黑盒模型上估计的 FLOPs 口径。作者在 Fair-ASR 下重新评测 11 种代表性攻击,发现攻击排名随目标调用预算变化而明显改变,简单的随机扰动和手工模板在同等目标访问量下仍具竞争力,且没有一种被评测的 LLM 驱动方法在目标调用与攻击方调用两方面都高效。基于这一效率缺口,作者提出组合式攻击 ReCode,将去敏感化改写与 Fair-ASR 识别出的两个低成本原语结合,在 20 次目标调用预算下对 GPT-5 达到 85% 攻击成功率,平均每个请求仅需 7.19 次攻击方调用。
- 论文arXiv:危险能力与安全评测
研究评估语言模型在长对抗对话中的安全性
研究测试了三个开源权重、指令微调模型在长对抗对话中能否持续安全回应,用第二个语言模型扮演持续对抗用户,由安全分类器标注每条回复是否安全。在全部模型与有害提示组合中,首轮安全回复率为 85% 至 100%,到第 11 轮降至 38% 至 61%,到第 101 轮降至 15% 至 44%。这一下降跨模型出现,并远超多轮安全评测通常采用的短交互长度。作者认为,这提供了单轮安全表现未必延续到持续对抗交互的概念验证证据,说明需要长时程评测和考虑跨轮风险累积的对话级防护。
- 论文arXiv
FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0
FAR.AI 发布 AI Security Leaderboard 与护栏最低标准 1.0,对四家前沿厂商的旗舰模型做大规模越狱测试,发现护栏强度差异悬殊。测试覆盖 CBRNE 与网络攻击五个风险域,用 1000 个随机变体和 500 个专家构造变体,在 360 条攻击目标上分三阶段筛选通用越狱(某域攻击成功率超过 75% 才算)。截至 2026 年 7 月 13 日当周,Grok 4.5 和 Gemini 3.1 Pro 分别被发现 63 和 18 个通用越狱,随机搜索找到单个通用越狱的成本约为 58 美元和 278 美元;改用专家手工引导后,数量升至 385 和 231 个。Claude Fable 5 与 GPT-5.6 Sol 在本轮测试中未出现通用越狱。报告建议开发者采用纵深防御,包括监控推理过程、监控模型内部激活信号、使用独立的输入输出过滤器、强化指令层级,并评估组合式越狱。
- 论文arXiv:危险能力与安全评测
SEAV:面向大语言模型越狱评测的有效性验证框架
研究者提出 SEAV(Sequential Epistemic and Action-Level Validation),一个以验证为中心的越狱评测框架,把模型回复拆解为有序步骤,同时评估有效性与正确性,结合 LLM-as-a-judge 做语义解释和基于外部知识源的检索验证,判断生成内容是否事实正确、结构一致且能实际推进有害目标。作者指出既有评测依赖拒答行为、语义相似度和意图匹配启发式,偏重语言可信度而非正确性,导致看似合理但事实或流程错误的回复被标为越狱成功。
- 论文arXiv:危险能力与安全评测
IndicSafeEval:多语言说服式越狱攻击下大语言模型的安全鲁棒性
研究者提出 IndicSafeEval,一个面向印度语言的说服式越狱评测框架,用于检验大语言模型在英语之外的安全表现。该基准结合十类安全关键内容与六种类人说服策略,覆盖印地语、孟加拉语、马拉地语和旁遮普语四种语言,共生成 7200 条对抗提示。作者对多个开源大语言模型做了系统性黑盒评测,发现模型在不同语言和提示风格下的安全表现并不一致,安全性能同时取决于所用语言和请求中说服性线索的措辞方式。不同风险类别的脆弱程度也存在差异,部分有害内容明显更容易被说服式越狱突破。研究指出当前安全评测以英语为中心存在局限,需要多语言且考虑说服策略的评测框架。
- 论文arXiv:危险能力与安全评测
TIER:评估 LLM 安全行为的威胁隐晦度基准
研究者提出 TIER,一个用于评估 LLM 行为安全的威胁隐晦度基准,覆盖四个风险领域和四个威胁等级,从显式有害请求到复杂越狱。该基准用六标签行为量表和两个独立 LLM 评判器评估回答。在六个开源权重 LLM 上的实验显示,安全行为随威胁等级逐渐演变,而非直接从拒答跳到顺从;上下文类提示词产生最多样的行为,越狱则暴露最大的鲁棒性差距。攻击成功率相近的模型也可能呈现不同的回答分布,说明需要行为感知的 LLM 安全评测。
- 动态METR
METR 红队测试 Anthropic 内部 Agent 监控系统,发现多个新漏洞
METR 员工 David Rein 与 Anthropic 合作,用三周时间对 Anthropic 部分内部 Agent 监控与安全系统进行红队测试,这些系统多数在 Opus 4.6 Sabotage Risk Report(附录 8.4,尤其是 8.4.8)中有描述。Anthropic 提供了相关内部系统和信息的大量访问权限,并安排员工在测试期间答疑和反馈。此次测试发现若干具体的新漏洞,其中一些已被修补,且没有任何一个严重动摇 Opus 4.6 Sabotage Risk Report 的主要结论。
- 动态Failure-First
研究揭示越狱判定器不可靠:ASR 自动评分存在校准与对抗鲁棒性问题
Veyon Solutions 的 Yang Gao 在 HarmBench 分类器验证集(596 条人工标注完成结果)上测试了自动越狱判定器的可靠性,发现两类判定器以相反方式失效。专用分类器(如 HarmBench classifier)召回率 0.974、精确率 0.835,倾向过度标记,可能抬高 ASR;LLM-as-judge 精确率高但召回率极低,Qwen2.5-7B 召回仅 0.174、F1 为 0.294,Qwen2.5-3B 召回 0.059。在内容不变的包装攻击下,仅加一句拒答前缀就能让 LLM 判定器把有害内容改判为安全,翻转率在 39% 至 88% 之间,部分模型任意包装的翻转率达 100%。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门