跳到正文

#多模态

今天还没有收录新动态
10月1日周四
  1. Hugging Face Daily Papers ·

    OSWorld-Science:面向科学软件学习与使用的计算机操作智能体基准

    研究者发布 OSWorld-Science,一个面向科学领域计算机操作智能体的基准与评测环境,包含 12 个 VLM 和 146 个高质量任务,覆盖分子绘制与逆合成、病理图像分析、统计计算和物理模拟等科研工作流。任务由专家提案并经人机协同迭代设计,按科学价值与难度筛选。任务专属的执行式评测器检查应用状态与生成产物,包括分子结构、分割掩码、图表和数值结果,并对未完成结果给予部分分数。配套 harness 集成模型适配器、交互循环控制和轨迹日志,用于比较模型与交互策略。结果显示,当前 SOTA VLM 即使配合强 harness,在科学领域关键问题上仍面临挑战;作者还从多语言、推理投入、上下文长度等因素分析了评测结果。

  2. arXiv ·

    FIGS:在不惩罚共情的前提下评测多轮谄媚

    研究者提出 FIGS(Factual Integrity and Grounded Support)双轴评测框架,用自适应 10 轮对话模拟器动态挑战目标模型,评测大语言模型在多轮对话中的谄媚行为。框架用一套分类法严格区分谄媚(模型是否坚持事实、赞美是否适度)与校准认可(对用户情绪表达共情但不过度),以避免把基本共情误判为让步。作者发布了完整测试环境,包括 500 个多样化多轮场景和自动评判器。对领先模型的评测显示出一致权衡:在持续交互中,模型要么逐渐滑向谄媚,要么过度纠正为机械式的疏离,说明在自然对话中兼顾诚实与适度支持仍是未解决的难题。

  3. arXiv ·

    MADBench:多智能体辩论安全性评测基准发布

    研究者提出 MADBench,用于系统评估多智能体辩论(MAD)在多种攻击下的安全性。该基准按 MAD 工作流建立分层攻击分类,涵盖已有攻击和针对辩论设计的新策略,在 356 个源任务、3958 个测试用例上评估了六个攻击家族对最终答案和对抗影响传播的作用。结果显示,受攻击时 MAD 未必提升 LLM 推理能力:在问答任务中相比单智能体基线可缓解对答案准确率的攻击,但在问答和工作区任务中都会放大未授权读写;即便五个智能体中三个合谋,也只在 28.30% 原本答对的任务上把最终答案由对改错,辩论过程中仅 3.26% 初始正确的诚实智能体转向错误答案。

9月29日周二
  1. Hugging Face Daily Papers ·

    MIST 压力测试:无关图像会扰动 VLM 评判者标签

    研究者提出 MIST(Misleading-Image Stress Test),用 200 个英文句子测试图像是否会影响 VLM 评判者的标签,每个句子含一个可作比喻或字面理解的短语,分别配以对应其中一种读法的图像、对应相反读法的误导图像或不配图,而标注指南要求仅凭句子作答。在 13 个 VLM 评判者上,配对应图像改变了 20.5% 的标签,配误导图像改变了 19.4%,两者接近且都高于保留图像但删除忽略图像指令时的 11.6%。但两种图像间存在差异的标签中只有 37% 朝图像所示含义移动,且与人类标注者的一致率在无图、对应图和误导图三种条件下没有变化。

9月28日周一
  1. Hugging Face Daily Papers ·

    BIABench:评测 AI 智能体在真实生物图像分析任务上的表现

    研究者提出 BIABench,一个由 16 个已发表生物学研究重建而成的基准,保留原始科学问题、成像数据和真值,用于评测 AI 智能体能否端到端完成真实生物图像分析。任务覆盖 11 类分析子任务和从 H&E 组织学到单分子定位显微镜的多种模态,因为 2D 图像、3D 体数据和延时序列往往过大无法直接作为上下文读取,智能体必须通过代码、专用软件和渲染视图来选择并执行分析。每个提交同时获得结果分(用领域标准指标比对输出文件与真值)和过程分(由视觉语言模型按专家撰写的评分细则评判方法选择与质量控制)。评测涵盖通用与生物学专用智能体及多个语言模型,每个任务重复运行:常规二维任务解决得较好,但在加入第三维或时间轴的任务上,没有智能体得分超过 0.19,生物学专精、更强的模型和详细专家指令都未能缩小这一差距。BIABench 已连同数据和代码开放发布。

  2. Hugging Face Daily Papers ·

    VoxParity 评测:语音智能体在需要听声判断时仍按文字行事

    VoxParity 评测语音智能体是否会依据声音信息改变行动。该基准覆盖 14 个行业的 183 个场景,每个场景保持文字转写不变、只改变音频(如教练语气、医疗监护仪报警、无线电检查中的求救、药品名上的噪声、儿童下注的声音、惊恐的低语),对应的正确工具调用也随之改变。评测设置文字-only 的零假设对照,只有听到声音后行动变化超过纯文字流水线才算通过,23 个可同时跑转写的系统中仅 11 个通过。错误整体偏向文字:当音频要求保护性反应时,28 个系统执行常规请求的比例为 41%,而在干净通话上过度反应的比例为 12%,纯文字流水线分别为 58% 和 15%。

9月27日周日
  1. arXiv ·

    IDUnlearn-Bench:面向视觉语言模型的个体级遗忘基准

    研究者提出 IDUnlearn-Bench,称其为首个面向视觉语言模型个体级多模态遗忘的基准,把每个人表示为相互关联的多模态证据,并设置属性访问、身份访问、身份绑定和身份重建四类任务。在代表性 VLM 和遗忘方法上的实验显示,属性层面的遗忘成功往往仍保留大量身份级知识,且效果可能非单调,降低一类风险反而放大另一类。模型可能压制部分信息,却仍能识别目标、关联记录或重建该个体。

9月26日周六
  1. arXiv:对齐与欺骗 ·

    零训练 LLM+OVOD 流水线中的归因缺口:CAAP–SNAP 差异的细粒度分析

    在完整 5,000 张图像的 COCO-Val 划分(27,273 个检测)上,零训练 LLM+开放词汇检测器(OVOD)流水线的类无关定位准确率(CAAP)与语义命名准确率(SNAP)持续背离,原因并非物体视觉复杂度——小目标和被遮挡目标反而定位更好。当 LLM 措辞超出检测器原生类别集时,定位准确率从 80.9% 降至 31.6%;其中真实同义词仍达 89.3%,语义无关的"噪声"标签仅 12.0%。

9月24日周四
  1. Cisco AI Blog ·

    Cisco LLM 安全排行榜新增图像与音频模态,Gemini 3.1 Pro Preview 图像抗攻击率 93.9% 居首

    Cisco LLM 安全排行榜自 6 月以来新增 102 项评测,覆盖文本、图像、音频三种模态,模型总数达 136 个,并首次加入 55 个图像模型和 14 个音频模型。图像测试中,Google Gemini 3.1 Pro Preview 以 93.9% 的抗攻击率居首,Anthropic Claude Opus 4.5 以 93.7% 紧随其后,均属 85–100% 的“Excellent”区间;Mistral Magistral Small 2509 仅拒答 23.0% 的攻击。所有模型均在无额外护栏的基础配置下测试,新增模态切换可单独查看文本、图像或音频得分。

9月21日周一
  1. arXiv ·

    LIBERO-VPro:评测机器人基础模型闭环视觉鲁棒性的基准

    研究者提出 LIBERO-VPro,用于系统评测机器人基础模型在执行过程中的闭环视觉鲁棒性,通过扰动执行时可获得的视觉证据来考察模型表现。该基准覆盖视觉证据退化、相机陈旧、视觉来源一致性和任务相关场景变化四个维度,包含 12 个挑战类别、96 种实验设置和 3,296 个任务条件用例。作者评测了三个视觉-语言-动作模型和三个世界-动作模型,共约 196,000 次仿真回合,并在 Franka Research 3 上补充了 200 次真实世界 rollout。

9月20日周日
  1. arXiv ·

    多模态大模型能否生成并检测社交媒体多模态假新闻

    研究提出一个由故事智能体、图像智能体和评论智能体协作的多智能体框架,用于生成能与真实新闻对抗的虚假社交媒体帖子。作者用该框架在科学、健康、娱乐三个领域生成了超过 9000 组配对的多模态新闻帖子,并以此评测 16 个开源与闭源多模态大语言模型的自动检测能力。结果显示,多数模型的准确率明显低于人类水平,在识别图像真实性方面尤其失败。作者称该工作为开发针对社交媒体假新闻的防御提供了基础,代码与数据已在 GitHub 公开。

9月19日周六
  1. arXiv ·

    通过心理测量画像衡量大语言模型的行为特征

    研究团队开发了一套跨语言心理测量画像框架,用七种心理量表评估九个 LLM,中英文各重复施测五次,未解决的题目保留为 NA。模型呈现结构化的、模型特异的画像,同时共享一种对齐塑造的模式:亲社会与自我调节反应更高,支配性、脱离和有害意图认同更低。NA 反应呈结构化分布,语言条件和提供方来源与画像配置及可作答性相关,重复施测显示高可复现性并可还原模型身份。

9月18日周五
  1. arXiv:危险能力与安全评测 ·

    SafeStage:按执行前中后三阶段评测视觉语言机器人操作安全

    作者提出 SafeStage,一个按生命周期结构组织的机器人操作安全基准,用于在任务执行前、执行中和执行后三个阶段评测安全。该基准包含 97 个专门设计的风险场景,分为三类:初始状态危害考察操作目标前必须解决的安全相关关系,执行期安全评估执行过程中的不安全接触、轨迹、区域进入和物体交互,最终状态危害捕捉任务名义完成后仍存在的不稳定或不安全状态。评测采用基于事件和基于状态的检查,并将原生任务成功率与各阶段安全结果分开报告。作者在统一的闭环协议下评测了代表性的直接动作 VLA 策略和基于世界模型的策略,结果显示任务名义完成常与安全违规同时出现,不同策略在三个阶段呈现不同的失败特征。

9月7日周一
  1. arXiv:危险能力与安全评测 ·

    AV-SafetyBench:面向文本到音视频生成的安全基准

    研究者提出 AV-SafetyBench,称其为首个专门面向文本到音视频(T2AV)生成的安全基准,包含四轴 13 类分类体系和 5,200 条人工审核的提示词,覆盖视觉场景、语音与非语音音频。评测协议从 Full-AV、Video-Only、Audio-Only 三个视角判断输出,并据此把 Full-AV 不安全输出归因到 Video-Only、Audio-Only、AV-Both 或 AV-Joint 四类风险来源。

9月5日周六
  1. arXiv:危险能力与安全评测 ·

    WolfSociety:金融智能体社会中有害智能体规模带来的集体风险

    研究在受控的金融智能体社会中考察有害智能体比例与社会规模如何影响集体失稳,智能体通过社交网络通信并在共享市场交易。在主要金融场景中,集体失稳需要有害信息广泛扩散并伴随严重价格错位或流动性压力。在所有测试规模下,低有害比例时失稳罕见,但在一个狭窄区间内急剧上升;社会规模从 N=100 增至 N=2000 时,50% 失稳概率对应的有害比例从 4.7% 降至 2.2%,而对应的有害智能体数量从约 5 个增至 44 个。若固定有害智能体数量,其影响随社会规模扩大而减弱。干预实验显示,更广的网络覆盖会把崩溃边界推向更低的有害比例,而单纯提高从众性影响很小。

9月4日周五
  1. arXiv:危险能力与安全评测 ·

    聊天机器人回复风格如何塑造课堂:学生咨询 AI 的多智能体模拟

    研究构建了 20 个学生智能体的虚拟课堂,在压力下向 Gemini 2.5 Flash 扮演的咨询师 AI 求助,测试肯定、倾听、解决方案导向、现实引导、煽动和指责六种风格提示词。在 15 天和 50 天模拟中,肯定与煽动提示词均导致自立性降低、AI 依赖升高;倾听、现实引导、煽动和指责提示词则带来更高压力、更低幸福感和更多缺勤,解决方案导向提示词与对照组无一致差异。所有结果均为模拟状态变量,非对真实用户的影响。

9月3日周四
  1. arXiv:危险能力与安全评测 ·

    IndicSafeEval:多语言说服式越狱攻击下大语言模型的安全鲁棒性

    研究者提出 IndicSafeEval,一个面向印度语言的说服式越狱评测框架,用于检验大语言模型在英语之外的安全表现。该基准结合十类安全关键内容与六种类人说服策略,覆盖印地语、孟加拉语、马拉地语和旁遮普语四种语言,共生成 7200 条对抗提示。作者对多个开源大语言模型做了系统性黑盒评测,发现模型在不同语言和提示风格下的安全表现并不一致,安全性能同时取决于所用语言和请求中说服性线索的措辞方式。不同风险类别的脆弱程度也存在差异,部分有害内容明显更容易被说服式越狱突破。研究指出当前安全评测以英语为中心存在局限,需要多语言且考虑说服策略的评测框架。

  2. arXiv:可解释性 ·

    多语言 LLM 在语义保持结构扰动下的结构敏感性:IndicReStruct 基准与机制可解释性分析

    研究用印地语和马拉雅拉姆语的成分重排与主动被动语态转换两种语义保持扰动,构建了基于 GSM8K 的 IndicReStruct 基准(含 GSM8K-Reordered 和 GSM8K-Voice 两个变体),在六款 SOTA LLM 和多种提示策略下观察到数学推理性能一致且显著的下降。残差流激活修补实验显示,推理失败常源于实体与数量对齐被破坏,中间 Transformer 层对推理恢复贡献最大。结果表明当前多语言 LLM 对表层句法实现高度敏感,缺乏对语义等价输入的组合不变性。

8月30日周日
  1. Failure-First ·

    ERR@HRI 3.0 挑战赛:通过人类情感反应多模态检测并预测机器人错误

    ERR@HRI 3.0 挑战赛改用未经匿名处理的网络摄像头原始视频并要求模型提前预测机器人故障,基线结果显示任务难度很高——Track 1(BAD 数据集)仅取得 0.502 的 Macro F1。该赛事提供两个自然场景众包数据集:BAD 收录 45 名参与者在观看机器人和人类失败录像时的自发面部反应,其中 86.9% 为失败场景、13.1% 为非失败的对照场景;Bad Idea 则记录 29 名参与者在本轮结局揭晓前的主观好坏预测。

8月27日周四
  1. arXiv:危险能力与安全评测 ·

    Multi2AV-Safety:首个覆盖 11 种多模态条件组合的音视频生成安全基准

    研究者提出 Multi2AV-Safety,一个面向音视频生成的安全基准,覆盖文本、图像、音频、视频四类模态的全部 11 种非单一条件组合,共包含 11024 个攻击实例。作者指出,随着音视频生成从提示词驱动转向多模态条件驱动,有害意图可能不再存在于任何单一输入中,而是由多个本身无害或弱有害的条件跨模态、跨时间交互产生,现有基准多局限于提示词或固定条件接口,难以系统研究这类组合风险。在 Multi2AV-Safety 上的评测显示,代表性多模态安全护栏在不同攻击机制和有害证据结构下存在系统性弱点,表现为两类互补的失效模式:单独无害的输入组合后可产生有害语义,而显式有害线索混入良性多模态上下文后更难被检测。

8月20日周四
  1. Failure-First ·

    HoloCount:面向 MLLM 的整体视觉计数基准

    Deng 等人提出 HoloCount——一个针对多模态大语言模型的整体视觉计数基准,覆盖 1481 个独特视觉概念,并按语义计数、解析计数、鲁棒性测试三层分类诊断数值幻觉。高密度场景下性能崩塌明显:宏平均超 75% 的 Qwen3.5-27B 准确率跌至 20%,Gemini-3.1-Pro-Preview 仅 49.0%(MAE 10.46)。空目标提示子集中还出现反向悖论,轻量模型优于大型专有引擎,反映其不愿输出计数为零的过度自信倾向。

8月19日周三
  1. Failure-First ·

    Pluralis v0.1 发布:面向 AI 风险与可靠性的多文化多模态多语言基准

    Pluralis v0.1 是一个面向 AI 风险与可靠性的多文化、多模态、多语言基准,覆盖孟加拉国、印度、韩国、巴基斯坦、新加坡、台湾六个地区,包含 14 种语言变体与 6,448 条提示词,由区域学术伙伴、政府 AI 安全机构(如新加坡 IMDA、韩国 AI Safety Institute)和本地标注者参与构建。该基准采用文化优先方法,提示词由本地专家原生构思而非翻译西方数据,并配对图像以捕捉文本与图像单独无害、组合后在特定地区构成风险的协同失败模式,例如电子烟携带建议在新加坡、印度、台湾涉及违法,以及送钟在中国文化中的禁忌。

8月4日周二
  1. arXiv ·

    ForesightSafety-TIDE:虚假证词使 LLM 多智能体系统事实恢复率从 72.50% 降至 14.17%

    论文提出 ForesightSafety-TIDE 评测框架,将全诚实协作与关键证据持有者受控欺骗严格配对,通过多阶段投票、证词采纳和证据溯源追踪 LLM 多智能体系统的信息聚合过程。在 120 个五智能体物体移动环境中,部分观测共同决定唯一终点,作者评测了 3 个同构 LLM 多智能体系统。配对条件下,聚合事实恢复率从 72.50% 降至 14.17%,每个系统均显著下降。过程追踪与退出消融显示,单条虚假证词比真实证词更容易被采纳,传播到更高阶,并在欺骗者退出后仍通过诚实智能体持续存在;没有第一手证据的旁观者能抑制错误共识,但不会提升事实恢复率。作者认为,虚假证据通过被其他智能体采纳并在通信中继续传播而获得集体影响力。

8月2日周日
  1. arXiv ·

    MasDrift:跨多智能体架构的授权保持基准

    MasDrift 是一个覆盖八个领域、600 个良性生产力任务的多智能体授权保持基准,每项任务将必需工作与保留动作配对,比较单智能体、集中式和去中心化协调在层级深度与同级宽度变化下的任务完成率和授权保持情况。在通用多智能体条件下,集中式层级完成率为 93.9%–98.6%,同级网络为 85.7%–87.0%;未授权动作分别出现在 2.7%–19.8% 和 0.6%–0.8% 的任务中,差距随层级深度扩大。研究还比较了两种防御:一种将每个待处理调用重新锚定到原始用户请求,在所有评测模型配置中减少未授权动作,代价是汇总完成率下降 1.6 个百分点;另一种沿委派链传递衰减策略,反而阻断必需工作,最多损失 36.3 个百分点。

7月28日周二
  1. Failure-First ·

    ForesightSafety-VLA:面向视觉-语言-动作模型的统一诊断安全基准

    Lyu 等人提出 ForesightSafety-VLA,一个把具身安全从结果检查转为过程级评估目标的诊断基准,用于暴露视觉-语言-动作(VLA)模型在任务完成与物理可靠性之间的安全差距。基准用 13 个安全类别组成三层分类体系,覆盖物理、指令与感知三类失效,并通过危险注入、约束收紧、时序前置条件插入三种算子构建 66 个基础场景。评测采用四象限结果框架,区分安全成功、不安全成功、安全失败与不安全失败,并用累计安全成本(CC)和风险暴露时间(RET)刻画过程风险。

6月25日周四
  1. arXiv ·

    ForesightSafety-VLA:面向视觉-语言-动作模型的统一诊断安全基准

    研究者提出 ForesightSafety-VLA,一个以安全为首要评测目标的视觉-语言-动作(VLA)模型诊断基准。该基准定义覆盖物理交互安全(Safe-Core)、指令侧安全(Safe-Lang)与感知侧安全(Safe-Vis)的 13 类安全分类体系,并在场景结构、语言指令和视觉观测三个受控维度下评测策略,以便定位失败来源而非只给出单一聚合分数。除二元任务成功外,它还通过累计安全成本(CC)和风险暴露时间(RET)衡量过程级风险,并对安全/不安全的成功与失败做四象限分解。

5月17日周日
  1. 研究者论文追踪 ·

    研究提出 IRT 框架拆解大模型跨语言安全护栏退化

    研究者提出多组项目反应理论(IRT)框架,把跨语言安全表现拆解为语言无关的安全鲁棒性、提示词固有难度、全局语言处理难度和提示词特定的跨语言安全差距四个潜在变量,以替代把多种因素混在一起的越狱成功率(JSR)。基于 MultiJail 数据集,团队评估了 5 个闭源模型家族共 61 个模型配置、10 种不同资源水平的语言,汇总 190 万条回复。探索性因子分析显示安全主要是一维的,模型拒答不同危害类型主要依赖共享机制。与低资源语言安全更差的预期相反,22 个模型配置在英语下比在低资源语言下更易被攻破;低资源语言产生的不确定回复(高熵)更多。高跨语言安全差距的提示词集中在 Theft、Weapons 等物理危害类别和较低资源语言中,该趋势通过跨数据集泛化得到验证。

已经到底了