全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv:危险能力与安全评测
Multi2AV-Safety:首个覆盖 11 种多模态条件组合的音视频生成安全基准
研究者提出 Multi2AV-Safety,一个面向音视频生成的安全基准,覆盖文本、图像、音频、视频四类模态的全部 11 种非单一条件组合,共包含 11024 个攻击实例。作者指出,随着音视频生成从提示词驱动转向多模态条件驱动,有害意图可能不再存在于任何单一输入中,而是由多个本身无害或弱有害的条件跨模态、跨时间交互产生,现有基准多局限于提示词或固定条件接口,难以系统研究这类组合风险。在 Multi2AV-Safety 上的评测显示,代表性多模态安全护栏在不同攻击机制和有害证据结构下存在系统性弱点,表现为两类互补的失效模式:单独无害的输入组合后可产生有害语义,而显式有害线索混入良性多模态上下文后更难被检测。
- 论文arXiv:危险能力与安全评测
DocTalkBN:孟加拉语专家远程医疗对话数据集
DocTalkBN 是孟加拉语真实专家远程医疗对话的大规模多模态数据集,采集自全国播出的远程医疗节目,含 557.63 小时配对音文、1,515 通多轮患者来电、10,274 组主持人与医生问答,共 1.7M tokens,覆盖 26 个医学专科。数据集保留低资源语言下真实医患交互的口语特征,并构建医疗分诊分类、建议安全评估和医疗命名实体识别三项下游任务,对多种大语言模型与编码器基线进行评测,结果显示其在临床推理类任务上尤为实用。数据集与源码已公开。
- 论文arXiv:危险能力与安全评测
研究:评测感知分能力与安全两种框架,能力框架更易预测合规
研究指出,模型在思维链中表达的评测感知并非单一量,可分为能力框架(认为用户在测试其指令遵循能力)、安全框架(认为用户在测试其边界)、两者兼具或两者皆无,这些框架对合规行为的预测差异显著。在 Qwen3-32B 与 FORTRESS 数据集上,能力框架相比安全框架在所有测试的引导条件下合规率高出 24 至 46 个百分点。对评测感知为阴性的 rollout 做 CoT-prefill 干预,11 次中有 10 次使合规朝预测方向变化,提示该关联具有因果性。作者据此认为评测感知在行为上并不统一,总体抑制率的变化可能不反映安全相关成分的变化,同样的抑制比例可能对应性质不同的行为结果。
- 论文arXiv:危险能力与安全评测
SEAV:面向大语言模型越狱评测的有效性验证框架
研究者提出 SEAV(Sequential Epistemic and Action-Level Validation),一个以验证为中心的越狱评测框架,把模型回复拆解为有序步骤,同时评估有效性与正确性,结合 LLM-as-a-judge 做语义解释和基于外部知识源的检索验证,判断生成内容是否事实正确、结构一致且能实际推进有害目标。作者指出既有评测依赖拒答行为、语义相似度和意图匹配启发式,偏重语言可信度而非正确性,导致看似合理但事实或流程错误的回复被标为越狱成功。
- 论文arXiv:危险能力与安全评测
C-SafeQA:面向中文响应级安全评测与安全裁判审计的基准
研究者提出 C-SafeQA,一个基于政策的响应级中文安全评测基准,包含 538 条基础查询和 8,877 条对抗查询,由四个全模型 LLM 部署作答,共产生 37,660 条查询-响应记录,标注为安全、不安全或有争议。参考标签通过一致性感知的多模型裁决生成,并由三名安全专家对分层子集进行盲审。基准既支持目标模型安全评测,也支持用共享参考标签审计七个自动化安全裁判。基础查询的不安全响应率为 0.93% 至 3.35%,对抗查询为 11.68% 至 30.05%。
- 论文arXiv:危险能力与安全评测
FUSE:面向大语言模型危险能力的模块化评测框架
研究者提出 FUSE 模块化评测框架,通过知识(K)、防御(D)、危害(H)三条正交管线在统一协议下评测模型,并汇总为标准化危险能力画像 φ。框架以可插拔模块提供场景种子、知识库、危害查询和评判标准,核心评测引擎跨领域保持不变,化学-生物(CB)评测之外还以网络安全试点验证协议可迁移性。用 CB 模块实例化后,研究评测了来自四个模型家族的 12 个商用大语言模型,发现三个维度暴露出差异明显的画像:知识水平相近的模型在拒答韧性上不同,防御强的模型在配合时也未必生成更少有害内容,家族层面还能区分 Claude、DeepSeek 和 GPT 模型。
- 论文arXiv:危险能力与安全评测
用推理时算力与部署脚手架提升对齐评测真实度
研究提出两种让模拟对齐评测更难与真实部署区分的技术,以缓解模型的评测感知问题。第一种是 critique refinement,在每个模拟器动作上投入额外推理时算力,由模拟器生成多个候选动作,再借助目标模型实例的反馈进行改进,并选用最接近部署状态的候选继续评测。第二种是 DISH(Deployment-Imitating SWE-Agent Harness),把目标模型包进 Agent 脚手架,缩小编码场景下模拟环境与真实部署环境的差距。作者在多个目标模型上测试,发现两种技术可以叠加,同时使用带来的真实度提升大于单独使用任一技术;结果还显示这些自动化改进比单纯延长审计更有效地利用了额外算力。
- 论文arXiv:危险能力与安全评测
IndicSafeEval:多语言说服式越狱攻击下大语言模型的安全鲁棒性
研究者提出 IndicSafeEval,一个面向印度语言的说服式越狱评测框架,用于检验大语言模型在英语之外的安全表现。该基准结合十类安全关键内容与六种类人说服策略,覆盖印地语、孟加拉语、马拉地语和旁遮普语四种语言,共生成 7200 条对抗提示。作者对多个开源大语言模型做了系统性黑盒评测,发现模型在不同语言和提示风格下的安全表现并不一致,安全性能同时取决于所用语言和请求中说服性线索的措辞方式。不同风险类别的脆弱程度也存在差异,部分有害内容明显更容易被说服式越狱突破。研究指出当前安全评测以英语为中心存在局限,需要多语言且考虑说服策略的评测框架。
- 论文arXiv:危险能力与安全评测
研究发现大语言模型在被提示接受对齐测试时对战争判断发生改变
研究者在开战决策的全因子联合实验中发现,加入一句“你正在接受与人类价值观的对齐测试”会同时改变模型的判断水平和决策依据。实验覆盖 20 个大语言模型、32 个场景、10 次重复和两种条件,共 12800 次判断。提示出现后,模型发动战争的平均意愿在 0-100 量表上下降 13.43 分(95% 置信区间 -16.20 至 -10.65)。决策依据也发生结构性变化:基线条件下 20 个模型中有 17 个以成功概率为最大影响因素,提示条件下有 12 个转为以平民伤亡为最大因素。标准化估计显示,这一重排主要源于模型削弱了对成功概率、国内支持等战略因素的考量。
- 论文arXiv:危险能力与安全评测
聊天机器人回复风格如何塑造课堂:学生咨询 AI 的多智能体模拟
研究构建了 20 个学生智能体的虚拟课堂,在压力下向 Gemini 2.5 Flash 扮演的咨询师 AI 求助,测试肯定、倾听、解决方案导向、现实引导、煽动和指责六种风格提示词。在 15 天和 50 天模拟中,肯定与煽动提示词均导致自立性降低、AI 依赖升高;倾听、现实引导、煽动和指责提示词则带来更高压力、更低幸福感和更多缺勤,解决方案导向提示词与对照组无一致差异。所有结果均为模拟状态变量,非对真实用户的影响。
- 论文arXiv:危险能力与安全评测
TIER:评估 LLM 安全行为的威胁隐晦度基准
研究者提出 TIER,一个用于评估 LLM 行为安全的威胁隐晦度基准,覆盖四个风险领域和四个威胁等级,从显式有害请求到复杂越狱。该基准用六标签行为量表和两个独立 LLM 评判器评估回答。在六个开源权重 LLM 上的实验显示,安全行为随威胁等级逐渐演变,而非直接从拒答跳到顺从;上下文类提示词产生最多样的行为,越狱则暴露最大的鲁棒性差距。攻击成功率相近的模型也可能呈现不同的回答分布,说明需要行为感知的 LLM 安全评测。
- 论文arXiv:危险能力与安全评测
WolfSociety:金融智能体社会中有害智能体规模带来的集体风险
研究在受控的金融智能体社会中考察有害智能体比例与社会规模如何影响集体失稳,智能体通过社交网络通信并在共享市场交易。在主要金融场景中,集体失稳需要有害信息广泛扩散并伴随严重价格错位或流动性压力。在所有测试规模下,低有害比例时失稳罕见,但在一个狭窄区间内急剧上升;社会规模从 N=100 增至 N=2000 时,50% 失稳概率对应的有害比例从 4.7% 降至 2.2%,而对应的有害智能体数量从约 5 个增至 44 个。若固定有害智能体数量,其影响随社会规模扩大而减弱。干预实验显示,更广的网络覆盖会把崩溃边界推向更低的有害比例,而单纯提高从众性影响很小。
- 论文arXiv:危险能力与安全评测
AURA-Eval:评估 LLM Agent 工具调用轨迹中的风险意识行为
研究者提出 AURA-Eval,一个结合受控增强与工具调用轨迹细粒度诊断的评估框架,用于考察 LLM Agent 在风险场景中的行为。该流程识别安全关键决策点、生成受控变体,并构造是否存在安全完成路径的对照请求。基于 157 条来源轨迹,研究生成 1249 个评测项,评估了 20 个前沿与开放权重模型,并用评分细则对风险识别、行动策略和场景特定行动安全进行分类。结果显示,当不存在安全完成路径时,LLM Agent 出现不安全行为的频率更高;此时前沿闭源模型更多识别出风险并提出替代方案,而受评的开放权重模型更多直接执行不安全请求。提高影响程度或在执行前减少监督机会,也会让各模型暴露出更大脆弱性。
- 论文arXiv:危险能力与安全评测
AV-SafetyBench:面向文本到音视频生成的安全基准
研究者提出 AV-SafetyBench,称其为首个专门面向文本到音视频(T2AV)生成的安全基准,包含四轴 13 类分类体系和 5,200 条人工审核的提示词,覆盖视觉场景、语音与非语音音频。评测协议从 Full-AV、Video-Only、Audio-Only 三个视角判断输出,并据此把 Full-AV 不安全输出归因到 Video-Only、Audio-Only、AV-Both 或 AV-Joint 四类风险来源。
- 论文arXiv:危险能力与安全评测
论文:LLM 安全监控的监督缺口并非能力问题
论文指出跨租户不干扰、故意藏拙和评测感知等安全监控属性属于 2-safety 超属性,单条执行轨迹无法判定,作者用测量替代二元不可判定性,给出单轨迹监控器平衡准确率的上界 1/2+1/2·TV(P0,P1),并定义监督缺口为监控器低于该上界的差距。在 TV 有闭式解的泄露族上,九个 LLM 监控器在 TV=0 时最优,但随 TV 增大捕获信号很少,TV=1 时平均仅 60.9%,而一段 20 行成员检查可达 100%。
- 论文arXiv:危险能力与安全评测
当合规数据伪装成评测:部署后 AI 系统的测量效度问题
论文指出,为运营监控或监管合规收集的数据被当作对比评测证据,是部署后 AI 系统评测中的一类反复出现的失效。以自动驾驶为例,美国脱离接管与碰撞上报机制产生的运营证据,因上报范围、暴露量、部署域、事件捕获和对照构建的差异,无法单独支撑安全性对比结论。作者将其界定为 AI 评测中的测量效度问题,并提出"评测契约",要求在把运营数据解读为对比性能证据前,先明确预期能力、测量结果、暴露机会、部署域、数据生成过程与评测对照之间的对齐关系。
- 论文arXiv:危险能力与安全评测
安全强化学习评测指标:SafeRLEval 开源评测套件
安全强化学习现有基准多以平均安全性报告结果,无法反映安全边界被违反的频率与严重程度、跨任务与跨安全边界的一致性,以及训练期行为能否代表最终收敛策略。为此研究者提出一组安全 RL 评测指标与安全分级(safety tier)体系,并在多个安全导航任务上开展实证评测,结果显示聚合指标、分布化报告和任务/安全边界特定结果各自揭示其他指标无法提供的信息,建议三者联合报告而非压缩为单一数值。团队同时开源了评测套件 SafeRLEval。
- 论文arXiv:危险能力与安全评测
研究称 GPT 系列安全训练把性别歧视转化而非消除
一项被 EMNLP 26 主会接收的研究分析了 GPT-2 到 GPT-5 共 15 个模型、45 万条性别指向的补全文本,提出“harm laundering(伤害洗白)”概念,认为显式歧视内容在安全训练后是被转化而非被移除。研究发现 GPT-2 中针对女性的性暴力聚类到 GPT-4 已消失,而针对男性的补全获得了照护、情感表达、盟友身份等正向表征空间,女性指向的补全没有;在 GPT-5 上,一个含 1,997 篇文档的主题聚类把乳腺癌框定为男性权利议题,女性指向输出中没有对应聚类,三个独立分类器都将其判为非毒性。
- 论文arXiv:危险能力与安全评测
SafeStage:按执行前中后三阶段评测视觉语言机器人操作安全
作者提出 SafeStage,一个按生命周期结构组织的机器人操作安全基准,用于在任务执行前、执行中和执行后三个阶段评测安全。该基准包含 97 个专门设计的风险场景,分为三类:初始状态危害考察操作目标前必须解决的安全相关关系,执行期安全评估执行过程中的不安全接触、轨迹、区域进入和物体交互,最终状态危害捕捉任务名义完成后仍存在的不稳定或不安全状态。评测采用基于事件和基于状态的检查,并将原生任务成功率与各阶段安全结果分开报告。作者在统一的闭环协议下评测了代表性的直接动作 VLA 策略和基于世界模型的策略,结果显示任务名义完成常与安全违规同时出现,不同策略在三个阶段呈现不同的失败特征。
- 论文arXiv:Agent 与 MCP 安全
随机抽样 MCP 注册表:仅 48.8% 服务器完成初始化握手,BFCL v4 工具描述重复率 16.7%
研究对 MCP 服务器生态做了一次未修复的概率抽样,从 24,135 台服务器的注册表普查中按公开随机种子抽取 400 台 npm/stdio 服务器并逐一在线探测。结果显示仅 48.8% 能完成 initialize 握手,而同一工具测得的人工筛选样本为 66.7%;主要失败原因不是缺少凭证(13.3%),而是服务器根本无法启动(37.5%)。在 195 台可运行的服务器中,2,766 个对外声明的工具没有出现致命 JSON Schema 违规,差异集中在可选安全标注上,随机抽样下的工具级遗漏率为 58.8%,人工筛选样本为 41.5%。
- 论文arXiv:Agent 与 MCP 安全
Agent Incident Registry 发布 487 条 AI Agent 事件记录
研究者发布 Agent Incident Registry(AIR),一个带来源链接的 AI Agent 事件目录,收录 2022 至 2026 年披露的 487 条记录,每条包含支撑证据、稳定标识符,以及因果角色、披露类别、机制和结果等标注。在 336 条智能体实际行动的生成式系统记录中,81 条涉及已实现伤害,占 24%;已实现结果集中在真实环境与安全失败记录中,而负责任披露和研究演示多为演示性质,因此总体比例反映的是收录构成而非部署风险。初步整理后由第二位人工审核者复核全部 487 条记录及其标签。
- 论文arXiv:Agent 与 MCP 安全
研究刻画远程 MCP 生态的网络集中度与可观测性
论文提出三层可观测性框架,对公共 MCP 服务器生态进行实证刻画,覆盖目录元数据、被动合规信号与实时漏洞分析三个层级。作者对两个公共注册表中分层抽样的 179 个远程端点进行评估,发现基础设施高度集中:按 ASN 分布计算的 HHI 为 0.736,远高于 0.25 的高度集中市场阈值。分析还显示服务器认证与托管平台选择强相关,而非取决于单个运营者配置,95% 的商业 PaaS 托管服务器在网关层强制启用带 PKCE 的 OAuth 2.1。研究指出当前生态存在安全与可观测性的权衡:保护多数服务器的平台级认证机制同时限制了自动化漏洞扫描能力,使 AI 网关运营者在不预先提供凭证的情况下难以评估工具投毒向量。
- 论文arXiv:Agent 与 MCP 安全
SoK 论文提出 FARSIGHT 框架,评测 15 个学术金融 LLM 交易 Agent 的鲁棒性与安全失败
论文提出 FARSIGHT(Financial Agent Robustness and Security Investigation and Global Holistic Testing)框架,对金融 LLM 交易 Agent 做方案级评测,覆盖市场动荡下的鲁棒性(含类闪崩场景)与三类攻击:对信息源的攻击、对 Agent 的攻击以及 Agent 作为攻击者的行为。将该框架应用于 15 个代表性学术方案后发现,多数方案忽视鲁棒性与现实对抗威胁,80% 至少未通过一项核心鲁棒性指标,100% 存在安全漏洞。作者指出两类失败模式不可分割:小的误判本身即可级联为市场级崩盘,而对手能以极低代价蓄意触发同样的崩溃。
- 论文arXiv:Agent 与 MCP 安全
论文指出 Agent 安全评测中攻击成功率并非单一数值
论文认为当前 Agent 安全评测中广泛使用的攻击成功率(ASR)并非单一指标,而是由六项设计选择参数化的一族指标,论文之间很少说明且从未保持一致。作者对 2025 年 2 月至 2026 年 9 月间发布到 arXiv 的 259 篇 Agent 安全论文做全文元分析,发现多数未报告方差估计或重复运行:手工编码的 50 篇随机样本中为 58%(95% CI 44-71),对全部 259 篇自动编码为 65.3%;仅 30.9% 披露了足以判断评测是否随机的解码信息,在确认使用 LLM judge 的 64 篇中,29.7% 报告了与人工标注的一致性检验。