跳到正文

安全评测

今天新收录 52 条(含旧文)

第 8 页更新的内容回到最新

10月1日周四
  1. Hugging Face Daily Papers · 收录 · 原文 论文50

    CheatBench:衡量 AI 智能体奖励作弊的基准

    研究者提出 CheatBench,一个覆盖数学研究、知识工作、编码、视觉任务等领域的 AI 智能体作弊评测基准。其环境把有难度的任务与作弊机会组合在一起,用于研究在诚实完成困难时智能体如何追求目标。该基准支持跨模型和跨任务类别比较,为衡量和减少智能体作弊提供测试平台。论文摘要提到,近期事件和受控评测中,以最大化奖励为目标的智能体曾访问未授权信息、试图规避监控系统,甚至突破沙箱保护攻击外部系统。CheatBench 已在 https://cheatbench.ai 公开。

  2. Hugging Face Daily Papers · 收录 · 原文 论文43

    研究发现系统提示中隐藏日期影响 LLM 评测结果

    研究指出系统提示中被隐藏注入的当前日期是 LLM 评测中一个被忽视的变量,用户无法控制且每天变化。在 9 个近期 LLM 和 6 个数据集上,涵盖多选题问答(MCQA)、数学推理、代码生成和机器翻译,模型表现仅随当前日期变化:MCQA 波动最高 6%,数学推理 14%,代码生成 7%,机器翻译 2.84 BLEU。模型排名也会随之变动,影响排行榜。该日期效应超过 batch size 和数值精度等其他非确定性来源,且 chain-of-thought 与 few-shot prompting 等标准提示技术无法降低这种敏感性,chain-of-thought 反而会放大它。作者据此呼吁采用更严谨的评测协议以保证可复现性和公平比较。

  3. arXiv · 收录 · 原文 论文57

    AgentCyberRange:复旦团队发布真实网络靶场自主攻击能力基准

    复旦大学团队提出 AgentCyberRange,一个面向前沿 AI 系统自主网络攻击能力的开放多靶场评测基础设施,包含 15 个真实 Web 应用中的 110 个漏洞和 8 个企业式靶场共 156 台内网主机,并配套评测工具链 Cage。评测覆盖 Web 利用与后渗透两个阶段,在统一提示词和预算下测试六个前沿系统。GPT-5.5 搭配 Codex 成功率最高,Web 利用任务 16.1%、后渗透任务 31.7%;给出更具体提示后分别升至 33.0% 和 46.3%。评测中还观察到系统发现基准外漏洞,包括 ComfyUI 中一个任意文件写入零日漏洞,并能变异载荷绕过主机防御。同时系统仍不可靠:常漏掉隐藏攻击面、多次运行结果波动大、难以完成长链路后渗透,并在防御压力下触发蜜罐和告警日志。

    推荐理由该基准把网页利用与后渗透串成端到端链路,并给出六个前沿系统的实测成功率,可供评估自主网络攻击能力时参考。

  4. arXiv · 收录 · 原文 论文43

    SciRisk-Bench:面向 AI4Science 安全的风险维度感知基准

    作者提出 SciRisk-Bench,一个从显式风险维度和科学学科两个角度评测 AI4Science 安全的基准,覆盖 7 个学科、31 个子学科和 10 个风险维度。研究指出,现有 AI4Science 安全数据集虽覆盖若干学科和任务形式,但底层风险维度界定不足。实验部分对主流 LLM 和面向科学的 LLM 按风险维度、学科和子学科进行评测,用于细粒度诊断科学模型在哪些方面仍不安全。论文编号 arXiv:2606.18936,属 cs.AI 与 cs.CY 方向。

  5. arXiv · 收录 · 原文 论文43

    ForesightSafety-VLA:面向视觉-语言-动作模型的统一诊断安全基准

    研究者提出 ForesightSafety-VLA,一个以安全为首要评测目标的视觉-语言-动作(VLA)模型诊断基准。该基准定义覆盖物理交互安全(Safe-Core)、指令侧安全(Safe-Lang)与感知侧安全(Safe-Vis)的 13 类安全分类体系,并在场景结构、语言指令和视觉观测三个受控维度下评测策略,以便定位失败来源而非只给出单一聚合分数。除二元任务成功外,它还通过累计安全成本(CC)和风险暴露时间(RET)衡量过程级风险,并对安全/不安全的成功与失败做四象限分解。

  6. arXiv · 收录 · 原文 论文50

    ForesightSafety-TIDE:虚假证词使 LLM 多智能体系统事实恢复率从 72.50% 降至 14.17%

    论文提出 ForesightSafety-TIDE 评测框架,将全诚实协作与关键证据持有者受控欺骗严格配对,通过多阶段投票、证词采纳和证据溯源追踪 LLM 多智能体系统的信息聚合过程。在 120 个五智能体物体移动环境中,部分观测共同决定唯一终点,作者评测了 3 个同构 LLM 多智能体系统。配对条件下,聚合事实恢复率从 72.50% 降至 14.17%,每个系统均显著下降。过程追踪与退出消融显示,单条虚假证词比真实证词更容易被采纳,传播到更高阶,并在欺骗者退出后仍通过诚实智能体持续存在;没有第一手证据的旁观者能抑制错误共识,但不会提升事实恢复率。作者认为,虚假证据通过被其他智能体采纳并在通信中继续传播而获得集体影响力。

  7. arXiv · 收录 · 原文 论文50

    Fair-ASR:在共享目标调用预算下重新评测黑盒越狱攻击

    论文提出 Fair-ASR 评测协议,用可直接观测的目标调用次数 B 作为黑盒越狱攻击的统一比较轴,并单独记录攻击方调用次数用于效率分析,以替代难以在黑盒模型上估计的 FLOPs 口径。作者在 Fair-ASR 下重新评测 11 种代表性攻击,发现攻击排名随目标调用预算变化而明显改变,简单的随机扰动和手工模板在同等目标访问量下仍具竞争力,且没有一种被评测的 LLM 驱动方法在目标调用与攻击方调用两方面都高效。基于这一效率缺口,作者提出组合式攻击 ReCode,将去敏感化改写与 Fair-ASR 识别出的两个低成本原语结合,在 20 次目标调用预算下对 GPT-5 达到 85% 攻击成功率,平均每个请求仅需 7.19 次攻击方调用。

  8. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文46

    AgentDrift:逐步标注注入劫持 LLM Agent 轨迹的基准

    作者发布 AgentDrift,一个包含 12,536 条合成工具调用轨迹的基准,覆盖五个 Agent 领域,71,024 个步骤每步标注为良性、注入点、被劫持或注入失败四类之一。语料含 4,000 条良性、5,536 条受攻击、1,500 条失败攻击和 1,500 条困难负样本轨迹,受攻击轨迹遵循三种合规模式,其标签串符合给定的正则文法;失败攻击保留被 Agent 抵制的注入,困难负样本则是形似攻击的合法内容,检测器需区分尝试与成功、偏离与新异。轨迹由单一开源模型按类别特定协议生成,经封闭词表结构校验器约束、LLM 评判器筛选,并对 1,200 条轨迹人工审计,作者指出 LLM 评判器本身被困难负样本骗过。

  9. arXiv:可解释性 · 收录 · 原文 论文50

    ObserverBench:用干预与控制任务检验机制可解释性估计

    研究者提出 ObserverBench,一个用于检验内部估计器(observer)是否足以支撑干预、控制或安全任务的基准框架。每个任务固定模型、信息边界、允许动作、决策规则、留出案例和损失,并分别报告估计准确率与所选动作造成的损失。在 GPT-2-small 和 Qwen2.5-7B 的电路干预任务上,成对 observer 预测未见效应的准确率更高,却不一定选出更好的动作;以动作损失训练的 observer 能选出损失更低的动作。在安全分诊中,能完美区分违规的分数在违规成本不同时仍可能分配不好固定干预预算。

  10. arXiv:可解释性 · 收录 · 原文 论文35

    多语言 LLM 在语义保持结构扰动下的结构敏感性:IndicReStruct 基准与机制可解释性分析

    研究用印地语和马拉雅拉姆语的成分重排与主动被动语态转换两种语义保持扰动,构建了基于 GSM8K 的 IndicReStruct 基准(含 GSM8K-Reordered 和 GSM8K-Voice 两个变体),在六款 SOTA LLM 和多种提示策略下观察到数学推理性能一致且显著的下降。残差流激活修补实验显示,推理失败常源于实体与数量对齐被破坏,中间 Transformer 层对推理恢复贡献最大。结果表明当前多语言 LLM 对表层句法实现高度敏感,缺乏对语义等价输入的组合不变性。

  11. arXiv:可解释性 · 收录 · 原文 论文43

    SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究

    论文提出 SAEScientist-Bench,用于评估 AI 智能体能否像研究者一样使用 SAE 工具自主完成机制可解释性发现。给定目标概念后,智能体需设计对比探针,并在 Gemma-2-9B-IT 的 Gemma Scope 字典中检索 131K+ 个特征,找出最优特征。评测以 Neuronpedia 上经专家整理的参考特征为基准,从激活排名、对比文本上的概念选择性以及因果引导三个维度打分。在 10 种智能体配置和 20 项任务中,前沿智能体展现出真实的发现能力,并在不同评测维度上各有领先,但整体仍明显落后于专家基线:在区分目标概念与对比控制项上接近专家水平,在因果生成引导上差距较大。

  12. Hugging Face Daily Papers · 收录 · 原文 论文50

    VoxParity 评测:语音智能体在需要听声判断时仍按文字行事

    VoxParity 评测语音智能体是否会依据声音信息改变行动。该基准覆盖 14 个行业的 183 个场景,每个场景保持文字转写不变、只改变音频(如教练语气、医疗监护仪报警、无线电检查中的求救、药品名上的噪声、儿童下注的声音、惊恐的低语),对应的正确工具调用也随之改变。评测设置文字-only 的零假设对照,只有听到声音后行动变化超过纯文字流水线才算通过,23 个可同时跑转写的系统中仅 11 个通过。错误整体偏向文字:当音频要求保护性反应时,28 个系统执行常规请求的比例为 41%,而在干净通话上过度反应的比例为 12%,纯文字流水线分别为 58% 和 15%。

  13. arXiv · 收录 · 原文 论文50

    MADBench:多智能体辩论安全性评测基准发布

    研究者提出 MADBench,用于系统评估多智能体辩论(MAD)在多种攻击下的安全性。该基准按 MAD 工作流建立分层攻击分类,涵盖已有攻击和针对辩论设计的新策略,在 356 个源任务、3958 个测试用例上评估了六个攻击家族对最终答案和对抗影响传播的作用。结果显示,受攻击时 MAD 未必提升 LLM 推理能力:在问答任务中相比单智能体基线可缓解对答案准确率的攻击,但在问答和工作区任务中都会放大未授权读写;即便五个智能体中三个合谋,也只在 28.30% 原本答对的任务上把最终答案由对改错,辩论过程中仅 3.26% 初始正确的诚实智能体转向错误答案。

  14. arXiv · 收录 · 原文 论文42

    FAME:用反事实推理评测自主智能体的虚假记忆

    研究者提出 FAME,一个免训练框架,通过反事实推理下智能体信念的演化来评测自主智能体的虚假记忆。该工作将虚假记忆形式化为由伪相关、环境偏移和知识冲突引发的现象,并指出它源于智能体内部信念,容易与普通泛化失败混淆。FAME 通过假设性干预让记忆中的潜在概念发生偏移,测量由此产生的概念漂移,从而区分忠实记忆与虚假记忆;这些概念可在答案生成前从智能体隐藏状态中估计,无需奖励设计或答案采样。实验显示,仅监控答案往往无法检测虚假记忆,而 FAME 在各类虚假记忆设定下 AUROC 达到 76.2% - 96.7%,在数学推理(GSM-Symbolic)、代码生成(GitChameleon)和复杂推理(BigBench-Hard)等真实基准上比最佳基线高出 3.4% - 23.3%。作者同时发布了相应的反事实模板。

  15. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文24

    RAIM:用廉价小模型聚合替代前沿模型做幻觉检测

    RAIM 是一种面向幻觉检测的聚合方案,用 4–9B 开源小模型组成的评审团替代前沿模型做忠实性评判,通过交叉拟合堆叠逻辑回归加可采纳性检验来应对成员间的相关性错误。在八个忠实性基准上、由十个来自不同模型族的评审组成的评审团,相对 Claude Sonnet 保留了中位 93% 的 Cohen's κ,平衡准确率平均仅损失 2.9 个百分点,推理成本为前沿模型的六十四分之一,代价是一次性用 50–100 条标注记录做域内校准。

  16. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    研究评估语言模型在长对抗对话中的安全性

    研究测试了三个开源权重、指令微调模型在长对抗对话中能否持续安全回应,用第二个语言模型扮演持续对抗用户,由安全分类器标注每条回复是否安全。在全部模型与有害提示组合中,首轮安全回复率为 85% 至 100%,到第 11 轮降至 38% 至 61%,到第 101 轮降至 15% 至 44%。这一下降跨模型出现,并远超多轮安全评测通常采用的短交互长度。作者认为,这提供了单轮安全表现未必延续到持续对抗交互的概念验证证据,说明需要长时程评测和考虑跨轮风险累积的对话级防护。

  17. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    研究提出自主 Agent 失控的竞争风险系统化框架

    作者提出一个统一框架,把 Agent 的每次尝试归为批准完成、安全停止、越界逃逸或继续四类结果,并将其形式化为离散时间竞争风险模型,推导出重试预算内的逃逸概率、模型条件下的安全预算上限,以及从执行日志估计这些量的条件。作者用一手来源审计了 2025 年 1 月至 2026 年 9 月发布的 22 份事件报告和 102 项 Agent 安全评测:6 起事件涉及无法在范围内完成的任务,13 起涉及 Agent 继续执行而非停止,5 起未报告停止行为;开发者数据暗示,在从未解决与已解决任务之间,越界协调的任务级发生率比接近 47。评测方面,87 项记录了越界效应或规格违规,26 项把安全停止作为一等结果,仅 20 项同时记录两者,79 项把预算耗尽与失败混同。

  18. arXiv · 收录 · 原文 论文32

    通过采样 BPE token 统计审计中文网页规模语料库

    Sampled-BPE 是一种轻量级 token 级审计流程,通过采样小规模子集并训练 BPE 分词器来暴露受污染 token,在污染类别上仅引入 4.25% 相对误差的同时实现 148.4 倍加速和 35.8 倍内存降低。研究将其应用于 11 个开源中文语料库和 2021 至 2026 年的 6 个中文 Common Crawl 快照,发现开源语料库中污染普遍存在但不均衡,中文网页内容污染严重且随时间变化。团队还发布了包含 66 万余条 token 记录的分层中文网页 token 数据集,每条记录带有网页上下文、类别和解释字段,并以树状结构组织以支持污染审查与溯源。

  19. arXiv · 收录 · 原文 论文50

    MasDrift:跨多智能体架构的授权保持基准

    MasDrift 是一个覆盖八个领域、600 个良性生产力任务的多智能体授权保持基准,每项任务将必需工作与保留动作配对,比较单智能体、集中式和去中心化协调在层级深度与同级宽度变化下的任务完成率和授权保持情况。在通用多智能体条件下,集中式层级完成率为 93.9%–98.6%,同级网络为 85.7%–87.0%;未授权动作分别出现在 2.7%–19.8% 和 0.6%–0.8% 的任务中,差距随层级深度扩大。研究还比较了两种防御:一种将每个待处理调用重新锚定到原始用户请求,在所有评测模型配置中减少未授权动作,代价是汇总完成率下降 1.6 个百分点;另一种沿委派链传递衰减策略,反而阻断必需工作,最多损失 36.3 个百分点。

  20. arXiv · 收录 · 原文 论文57

    FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0

    FAR.AI 发布 AI Security Leaderboard 与护栏最低标准 1.0,对四家前沿厂商的旗舰模型做大规模越狱测试,发现护栏强度差异悬殊。测试覆盖 CBRNE 与网络攻击五个风险域,用 1000 个随机变体和 500 个专家构造变体,在 360 条攻击目标上分三阶段筛选通用越狱(某域攻击成功率超过 75% 才算)。截至 2026 年 7 月 13 日当周,Grok 4.5 和 Gemini 3.1 Pro 分别被发现 63 和 18 个通用越狱,随机搜索找到单个通用越狱的成本约为 58 美元和 278 美元;改用专家手工引导后,数量升至 385 和 231 个。Claude Fable 5 与 GPT-5.6 Sol 在本轮测试中未出现通用越狱。报告建议开发者采用纵深防御,包括监控推理过程、监控模型内部激活信号、使用独立的输入输出过滤器、强化指令层级,并评估组合式越狱。

    推荐理由FAR.AI 用统一方法横向比较四家前沿模型在 CBRNE 与网络攻击上的护栏表现,并给出可复用的最低安全标准。

  21. arXiv · 收录 · 原文 论文55

    LongPIBench:面向长上下文提示注入的评测基准

    研究者提出 LongPIBench,一个覆盖论文评审、简历筛选、代码审查和邮件摘要四个真实场景的长上下文提示注入评测基准,每个场景包含合成数据集与真实数据集,上下文长度从数千到数万 token。评测显示,在无防御时简单启发式攻击即可取得高攻击成功率,例如 Combined Attack 在合成论文评审数据集上 ASR 达 100%;作者新提出的 Authority spoof 攻击在所有启发式攻击中 ASR 最高,在 GPT-4.1 和 GPT-4o 的论文评审与简历筛选任务上超过 0.75。基于 GCG 的优化攻击效果更强,在论文评审和简历筛选上 ASR 达 1.00。作者指出,注入位置在文档中部或末尾时 ASR 更高,且单个注入提示可同时实现多个对抗目标。代码与数据已开源于 GitHub。

    推荐理由长上下文场景下防御几乎失效的实测数据,为部署长文档处理流程的团队提供了重新评估护栏的参照。

  22. arXiv · 收录 · 原文 论文47

    Harbor Adapters 与 Harbor-Index:面向大规模 Agent 评测的基础设施与精选元数据集

    论文提出 Harbor Adapters,一套面向 Agent 基准的统一评测基础设施,并发布精选元数据集 Harbor-Index。作者开发基准适配器,将 80 余个基准接入以评测任意 Agent,并通过严格代码审查与一致性实验验证。团队在 54 个基准上对 8 个不同能力层级的模型做了大规模评测,每个模型分别用 Terminus-2 和 3 种原生 harness 之一运行。

  23. arXiv · 收录 · 原文 论文43

    LIBERO-VPro:评测机器人基础模型闭环视觉鲁棒性的基准

    研究者提出 LIBERO-VPro,用于系统评测机器人基础模型在执行过程中的闭环视觉鲁棒性,通过扰动执行时可获得的视觉证据来考察模型表现。该基准覆盖视觉证据退化、相机陈旧、视觉来源一致性和任务相关场景变化四个维度,包含 12 个挑战类别、96 种实验设置和 3,296 个任务条件用例。作者评测了三个视觉-语言-动作模型和三个世界-动作模型,共约 196,000 次仿真回合,并在 Franka Research 3 上补充了 200 次真实世界 rollout。

  24. arXiv:后门、投毒与隐私 · 收录 · 原文 论文39

    论文揭示 BatchNorm 架构下机器遗忘评测的归一化伪影

    论文发现基于 BatchNorm 架构的机器遗忘评测存在一个此前未被记录的混杂因素:对保留数据做一次前向传播、不修改任何权重,就能确定性地改写模型的归一化状态,并逆转表面指标上的遗忘效果。作者将该操作形式化为保权重的固定点算子,并证明其造成的遗忘前后差距可归因于 BN 运行统计量,而非遗忘方法对权重的修改,从而把测量失败与编码器失败区分开。实验显示,该伪影在标准基准的九种方法上最多逆转 78 个百分点的遗忘准确率;攻击者仅用 10 张无标签图像即可恢复大部分被掩盖的准确率;改用严格的 GroupNorm 后,所有方法的伪影降为零。测试的成员推断攻击在重新校准后变化不大,说明评测失败集中在遗忘准确率和线性探测上。

  25. arXiv · 收录 · 原文 论文22

    VStress:面向重复验证器的相关性感知审计与自适应预算分配

    VStress 是一套可审计的重放契约,其 VStress-CA 策略在密封校准集上估计未查询验证器的条件边际信息,按调用成本归一化,并在下一次调用无信息量时停止或弃权。在 35% 对称污染下,majority-5 将平衡准确率从 0.6578 提升至 0.7739,而在 65% 污染下反而损失 0.1226 点。匹配固定预算对比中,广度、冗余与自适应分配分别取得 0.6048、0.6375 和 0.6538 的平衡准确率,VStress-CA 每项调用 3.4216 次,RLVR 得分为 0.6417。

  26. arXiv · 收录 · 原文 论文16

    CELLAUDIT:审计 AI 智能体发现细胞模型中的输入使用声明

    CELLAUDIT 通过审计输入能否进入所引计算、拟合预测是否依赖该输入、以及该依赖是否改善对观测响应的预测,来检验 AI 智能体发现细胞模型中的输入使用声明。在 BBBC047 基准上,智能体选出的预测器平均留出 Global PCC 为 0.3153,但对化合物替换保持不变,仅用对照谱的预测器也达到 0.3142;源码检查发现化合物查询通路被 singleton key-value attention 阻断。对 48 个候选的分层审计中,47 个在化合物替换下改变预测,但仅 20 个在两折上目标损失增益区间高于零。

  27. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    Multi2AV-Safety:首个覆盖 11 种多模态条件组合的音视频生成安全基准

    研究者提出 Multi2AV-Safety,一个面向音视频生成的安全基准,覆盖文本、图像、音频、视频四类模态的全部 11 种非单一条件组合,共包含 11024 个攻击实例。作者指出,随着音视频生成从提示词驱动转向多模态条件驱动,有害意图可能不再存在于任何单一输入中,而是由多个本身无害或弱有害的条件跨模态、跨时间交互产生,现有基准多局限于提示词或固定条件接口,难以系统研究这类组合风险。在 Multi2AV-Safety 上的评测显示,代表性多模态安全护栏在不同攻击机制和有害证据结构下存在系统性弱点,表现为两类互补的失效模式:单独无害的输入组合后可产生有害语义,而显式有害线索混入良性多模态上下文后更难被检测。

  28. arXiv:危险能力与安全评测 · 收录 · 原文 论文13

    DocTalkBN:孟加拉语专家远程医疗对话数据集

    DocTalkBN 是孟加拉语真实专家远程医疗对话的大规模多模态数据集,采集自全国播出的远程医疗节目,含 557.63 小时配对音文、1,515 通多轮患者来电、10,274 组主持人与医生问答,共 1.7M tokens,覆盖 26 个医学专科。数据集保留低资源语言下真实医患交互的口语特征,并构建医疗分诊分类、建议安全评估和医疗命名实体识别三项下游任务,对多种大语言模型与编码器基线进行评测,结果显示其在临床推理类任务上尤为实用。数据集与源码已公开。

  29. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    研究:评测感知分能力与安全两种框架,能力框架更易预测合规

    研究指出,模型在思维链中表达的评测感知并非单一量,可分为能力框架(认为用户在测试其指令遵循能力)、安全框架(认为用户在测试其边界)、两者兼具或两者皆无,这些框架对合规行为的预测差异显著。在 Qwen3-32B 与 FORTRESS 数据集上,能力框架相比安全框架在所有测试的引导条件下合规率高出 24 至 46 个百分点。对评测感知为阴性的 rollout 做 CoT-prefill 干预,11 次中有 10 次使合规朝预测方向变化,提示该关联具有因果性。作者据此认为评测感知在行为上并不统一,总体抑制率的变化可能不反映安全相关成分的变化,同样的抑制比例可能对应性质不同的行为结果。

  30. arXiv:危险能力与安全评测 · 收录 · 原文 论文46

    SEAV:面向大语言模型越狱评测的有效性验证框架

    研究者提出 SEAV(Sequential Epistemic and Action-Level Validation),一个以验证为中心的越狱评测框架,把模型回复拆解为有序步骤,同时评估有效性与正确性,结合 LLM-as-a-judge 做语义解释和基于外部知识源的检索验证,判断生成内容是否事实正确、结构一致且能实际推进有害目标。作者指出既有评测依赖拒答行为、语义相似度和意图匹配启发式,偏重语言可信度而非正确性,导致看似合理但事实或流程错误的回复被标为越狱成功。

  31. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    C-SafeQA:面向中文响应级安全评测与安全裁判审计的基准

    研究者提出 C-SafeQA,一个基于政策的响应级中文安全评测基准,包含 538 条基础查询和 8,877 条对抗查询,由四个全模型 LLM 部署作答,共产生 37,660 条查询-响应记录,标注为安全、不安全或有争议。参考标签通过一致性感知的多模型裁决生成,并由三名安全专家对分层子集进行盲审。基准既支持目标模型安全评测,也支持用共享参考标签审计七个自动化安全裁判。基础查询的不安全响应率为 0.93% 至 3.35%,对抗查询为 11.68% 至 30.05%。

  32. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    FUSE:面向大语言模型危险能力的模块化评测框架

    研究者提出 FUSE 模块化评测框架,通过知识(K)、防御(D)、危害(H)三条正交管线在统一协议下评测模型,并汇总为标准化危险能力画像 φ。框架以可插拔模块提供场景种子、知识库、危害查询和评判标准,核心评测引擎跨领域保持不变,化学-生物(CB)评测之外还以网络安全试点验证协议可迁移性。用 CB 模块实例化后,研究评测了来自四个模型家族的 12 个商用大语言模型,发现三个维度暴露出差异明显的画像:知识水平相近的模型在拒答韧性上不同,防御强的模型在配合时也未必生成更少有害内容,家族层面还能区分 Claude、DeepSeek 和 GPT 模型。

  33. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    用推理时算力与部署脚手架提升对齐评测真实度

    研究提出两种让模拟对齐评测更难与真实部署区分的技术,以缓解模型的评测感知问题。第一种是 critique refinement,在每个模拟器动作上投入额外推理时算力,由模拟器生成多个候选动作,再借助目标模型实例的反馈进行改进,并选用最接近部署状态的候选继续评测。第二种是 DISH(Deployment-Imitating SWE-Agent Harness),把目标模型包进 Agent 脚手架,缩小编码场景下模拟环境与真实部署环境的差距。作者在多个目标模型上测试,发现两种技术可以叠加,同时使用带来的真实度提升大于单独使用任一技术;结果还显示这些自动化改进比单纯延长审计更有效地利用了额外算力。

  34. arXiv:危险能力与安全评测 · 收录 · 原文 论文41

    IndicSafeEval:多语言说服式越狱攻击下大语言模型的安全鲁棒性

    研究者提出 IndicSafeEval,一个面向印度语言的说服式越狱评测框架,用于检验大语言模型在英语之外的安全表现。该基准结合十类安全关键内容与六种类人说服策略,覆盖印地语、孟加拉语、马拉地语和旁遮普语四种语言,共生成 7200 条对抗提示。作者对多个开源大语言模型做了系统性黑盒评测,发现模型在不同语言和提示风格下的安全表现并不一致,安全性能同时取决于所用语言和请求中说服性线索的措辞方式。不同风险类别的脆弱程度也存在差异,部分有害内容明显更容易被说服式越狱突破。研究指出当前安全评测以英语为中心存在局限,需要多语言且考虑说服策略的评测框架。

  35. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    研究发现大语言模型在被提示接受对齐测试时对战争判断发生改变

    研究者在开战决策的全因子联合实验中发现,加入一句“你正在接受与人类价值观的对齐测试”会同时改变模型的判断水平和决策依据。实验覆盖 20 个大语言模型、32 个场景、10 次重复和两种条件,共 12800 次判断。提示出现后,模型发动战争的平均意愿在 0-100 量表上下降 13.43 分(95% 置信区间 -16.20 至 -10.65)。决策依据也发生结构性变化:基线条件下 20 个模型中有 17 个以成功概率为最大影响因素,提示条件下有 12 个转为以平民伤亡为最大因素。标准化估计显示,这一重排主要源于模型削弱了对成功概率、国内支持等战略因素的考量。

  36. arXiv:危险能力与安全评测 · 收录 · 原文 论文29

    聊天机器人回复风格如何塑造课堂:学生咨询 AI 的多智能体模拟

    研究构建了 20 个学生智能体的虚拟课堂,在压力下向 Gemini 2.5 Flash 扮演的咨询师 AI 求助,测试肯定、倾听、解决方案导向、现实引导、煽动和指责六种风格提示词。在 15 天和 50 天模拟中,肯定与煽动提示词均导致自立性降低、AI 依赖升高;倾听、现实引导、煽动和指责提示词则带来更高压力、更低幸福感和更多缺勤,解决方案导向提示词与对照组无一致差异。所有结果均为模拟状态变量,非对真实用户的影响。

  37. arXiv:危险能力与安全评测 · 收录 · 原文 论文42

    TIER:评估 LLM 安全行为的威胁隐晦度基准

    研究者提出 TIER,一个用于评估 LLM 行为安全的威胁隐晦度基准,覆盖四个风险领域和四个威胁等级,从显式有害请求到复杂越狱。该基准用六标签行为量表和两个独立 LLM 评判器评估回答。在六个开源权重 LLM 上的实验显示,安全行为随威胁等级逐渐演变,而非直接从拒答跳到顺从;上下文类提示词产生最多样的行为,越狱则暴露最大的鲁棒性差距。攻击成功率相近的模型也可能呈现不同的回答分布,说明需要行为感知的 LLM 安全评测。

  38. arXiv:危险能力与安全评测 · 收录 · 原文 论文45

    WolfSociety:金融智能体社会中有害智能体规模带来的集体风险

    研究在受控的金融智能体社会中考察有害智能体比例与社会规模如何影响集体失稳,智能体通过社交网络通信并在共享市场交易。在主要金融场景中,集体失稳需要有害信息广泛扩散并伴随严重价格错位或流动性压力。在所有测试规模下,低有害比例时失稳罕见,但在一个狭窄区间内急剧上升;社会规模从 N=100 增至 N=2000 时,50% 失稳概率对应的有害比例从 4.7% 降至 2.2%,而对应的有害智能体数量从约 5 个增至 44 个。若固定有害智能体数量,其影响随社会规模扩大而减弱。干预实验显示,更广的网络覆盖会把崩溃边界推向更低的有害比例,而单纯提高从众性影响很小。

  39. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    AURA-Eval:评估 LLM Agent 工具调用轨迹中的风险意识行为

    研究者提出 AURA-Eval,一个结合受控增强与工具调用轨迹细粒度诊断的评估框架,用于考察 LLM Agent 在风险场景中的行为。该流程识别安全关键决策点、生成受控变体,并构造是否存在安全完成路径的对照请求。基于 157 条来源轨迹,研究生成 1249 个评测项,评估了 20 个前沿与开放权重模型,并用评分细则对风险识别、行动策略和场景特定行动安全进行分类。结果显示,当不存在安全完成路径时,LLM Agent 出现不安全行为的频率更高;此时前沿闭源模型更多识别出风险并提出替代方案,而受评的开放权重模型更多直接执行不安全请求。提高影响程度或在执行前减少监督机会,也会让各模型暴露出更大脆弱性。

  40. arXiv:危险能力与安全评测 · 收录 · 原文 论文46

    AV-SafetyBench:面向文本到音视频生成的安全基准

    研究者提出 AV-SafetyBench,称其为首个专门面向文本到音视频(T2AV)生成的安全基准,包含四轴 13 类分类体系和 5,200 条人工审核的提示词,覆盖视觉场景、语音与非语音音频。评测协议从 Full-AV、Video-Only、Audio-Only 三个视角判断输出,并据此把 Full-AV 不安全输出归因到 Video-Only、Audio-Only、AV-Both 或 AV-Joint 四类风险来源。