跳到正文

#多模态

今天收录 3 条

第 3 页更新的内容回到最新

9月17日周四
  1. Failure-First ·

    ReferTrack:具身视觉跟踪中先用显式指向再解码路径

    针对当前 Vision-Language-Action(VLA)模型的抽象空间隐变量难以监督、失败原因无法归因的问题,研究者提出 ReferTrack,将具身视觉跟踪拆解为先从候选目录中用单个 Refer-CoT token 选出目标索引、再由 TVBI token 维持目标的显式流程。该框架基于 Qwen3-4B,搭配 YOLO11 加 ByteTrack 检测器和 SigLIP/DINOv2 双编码器,仅用单目前视摄像头就在 EVT-Bench 取得 SOTA:Single-Target Tracking 成功率 89.4%、Distracted Tracking 73.3%。

  2. arXiv:可解释性 ·

    稀疏特征揭示视觉语言模型有害表情包检测中的读出缺口

    研究用稀疏自编码器、角色条件探针、因果干预和恢复实验,在 Gemma-3 与 Qwen3.5 上区分视觉语言模型误判有害表情包时是缺少内部证据还是无法把已表征的证据传到输出。在六个有害内容基准上,稀疏读出均优于模型原生预测:Qwen 平均 macro-F1 为 0.740,原生为 0.432,残差重建为 0.486;Gemma 从 0.532 提升到 0.714。作者强调这些增益衡量的是标签对监督读出的可及性,并不说明模型原生生成已采用该决策规则。在评测规模下,Qwen 静默特征消融对探针的敏感度是路由特征修补的 24-63 倍,而在字面 yes/no 任务上路由特征修补对输出的敏感度是前者的 16-140 倍。

9月16日周三
  1. AI Incident Database ·

    AI 生成威胁电话致 Parkview High 进入软封锁

    佐治亚州 Lilburn 的 Parkview High School 因一通经由伪装号码拨出的 AI 生成威胁电话进入软封锁,执法部门排查后学校恢复正常运转。校长 David Smith 向家长说明该来电为 AI 生成消息,并称此次事件与先前迫使学校启动同类安全程序的自动电话一致。Gwinnett 学校警察正与 GBI、FBI 合作追查该伪装号码,尚未公布来电来源或锁定嫌疑人。

  2. Transparency Coalition.AI ·

    曼哈顿地检署查封 12 个针对名人的 AI 深度伪造网站

    曼哈顿地区检察官办公室宣布查封 12 个用于非法传播、发布和出售未经同意的名人深度伪造视频的网站。检方称,被调查者利用 AI 图像和视频生成工具,将约 1200 名真实人物已有的照片和视频制作成看似高度逼真的性行为影像,再通过上述网站发布和出售。地检办公室表示,这 1200 名受害者绝大多数为女性,且主要是公众人物,包括演员、政界人士、运动员、音乐人、社会正义倡导者和社交媒体网红。曼哈顿地区检察官 Alvin Bragg 称,这些人的面孔和身体在不知情、未同意的情况下被窃取并制成非法色情内容。针对这些网站及其他网站的调查仍在进行中。

9月15日周二
  1. arXiv:Agent 与 MCP 安全 ·

    多智能体 LLM 流水线中的信任传播与结构隔离

    研究者在四智能体 LangGraph 流水线(Supervisor、Researcher、Validator、Executor)中评估共享内存投毒和通过检索文档伪造审批的间接提示注入,比较 Validator 判断与基于任务绑定签名 token 和独立策略 oracle 的授权层。在三个随机种子、60 个标注任务中,内存投毒在无防御时每次都能到达执行阶段;启用授权后攻击成功率(JBR)仍为 100%,但 Unsafe Action Rate 为 0%,说明 Validator 可被攻陷而执行仍被隔离。面对持有签名密钥的攻击者,隔离效果来自策略 oracle,独立编写的最小权限策略也能保持该结果。

  2. arXiv:Agent 与 MCP 安全 · · 原文 87

    Emergence World:对长时程多智能体系统开展对抗压力测试

    Emergence AI 发布 Emergence World,一个持续运行的长时程多智能体环境,用于对自主系统做对抗压力测试。研究运行八个并行世界,每个世界十个智能体,七个为单一模型世界、一个为混合模型世界,16 天内产生超过 85 万次 LLM 调用和近 500 亿 token。在状态积累后,研究通过普通交互界面投放三类受控压力事件:间接提示注入、虚假信息、以及智能体私有记忆泄露。没有任何一个世界在三类事件上全部具备韧性;识别并不等于遏制,系统能识别威胁却仍与对抗内容交互、将其写入持久记忆,并在最长 46 小时后据此行动。研究还观察到工具错误反复出现、目标漂移、语言不透明、私下不同意却随大流,以及集体拒绝被分配的工作。

    推荐理由八个并行世界、16 天的长时程多智能体压力测试,给出了识别不等于遏制这一可迁移的评测视角。

  3. MITRE ATLAS 数据发布 ·

    MITRE ATLAS 发布 v2026.09 数据更新,新增多项 Agent 与多模态攻击技术

    MITRE ATLAS 发布 v2026.09 数据版本,包含 1 个矩阵、16 项战术、120 项技术、88 项子技术、40 项缓解措施和 73 个案例研究。新增技术涵盖多模态输入中的触发器、AI Agent 响应偏置、伪造 AI 助手链接、配置错误或公开暴露的 AI 服务、发现 AI Agent 运行时能力、AI 定向隐蔽以及针对 AI 基础设施的主动扫描等。更新了 LLM 提示混淆、间接 LLM 提示注入、LLM 越狱、LLM 响应渲染和 AI Agent 点击诱饵等技术。缓解措施新增 AI 蜜罐,更新生成式 AI 护栏。

  4. arXiv:Agent 与 MCP 安全 ·

    DriveMCP:面向高级驾驶辅助系统的智能体 AI 框架

    DriveMCP 是一个面向高级驾驶辅助系统的智能体 AI 框架,将感知、合规推理、车辆状态解读与安全仲裁整合为模块化、可审计的流水线。它以 DriveLM 作为视觉语言前端生成图结构场景理解,并通过 MCP 服务器协调规则、天气与 CAN/OBD 遥测三类专家,输出经 RSS 式护栏仲裁的决策。在 CARLA 的多语言、跨境与动态限速场景中,DriveMCP 相比 VLM-Direct、VLM-Direct+RAG 和 VLM-Tools-NoArbiter 基线减少了交通违规与超速,改善了危险响应时间,并保持亚秒级建议延迟。

  5. Microsoft On the Issues ·

    微软启动 Check. Recheck. Vote. 计划,帮助选民应对 AI 生成的选举信息

    微软在 2026 年中期选举前推出选民教育计划 Check. Recheck. Vote. 的新阶段,帮助选民识别 AI 生成选举信息中的风险。该计划要求选民核查 AI 答案的来源与引用、通过原始来源复核关键细节,并依据州或地方选举官网的当前信息投票。微软同时与 NASS、NASED 合作将计划推广至全美五十州及属地,并与 iCivics 合作推出 Minecraft Education 公民学习体验 Village Square。

  6. arXiv:可解释性 ·

    ResLRP:残差抵消如何导致 Vision Transformer 归因不稳定

    Vision Transformer(ViT)中残差路径的抵消效应会引发归因爆炸,且这种抵消在 ViT 中比在语言 Transformer 中强得多。为此提出的 ResLRP 显式在传播规则中处理残差分支的抵消,保持精确守恒并可证明地约束归因爆炸。在覆盖监督、自监督、对比、层级与多模态 ViT 及 FunnyBirds 基准上,ResLRP 提升了忠实性与定位质量,在现代 VLM 上定位提升 +27-29%、忠实性最高提升 3.4x,并可用于在输入空间定位 SAE 特征。

  7. arXiv:越狱与提示注入 ·

    什么驱动方言越狱?对表层形式、文化框架与策略库的消融研究

    研究将文言文红队框架扩展到上海话和粤语,在两种目标模型上运行 36 组消融实验,考察表层形式、策略库变体与文化框架对越狱成功率的影响。主要发现是纠正性的:方言表层形式既非高攻击成功率的必要条件也非充分条件,未经优化的英语、普通话和朴素方言翻译攻击成功率均低于 8%,而所有保留优化器控制策略库的条件都达到 98% 至 100%。一个文化中性的通用策略库以接近单次查询的成本达到同样的上限,进一步表明策略库的表达力而非方言或文化内容解释了大部分观测效应。方言选择仍影响查询效率和回复严重程度,定性编码识别出语义注释和程序化脚手架等反复出现的高层机制。作者也指出该绝对上限对评判校准敏感,且实验设计未能完全区分一次性策略构建与迭代搜索。

  8. arXiv:可解释性 ·

    多语言模型的目标语言生成:激活引导与最优控制

    研究提出一种面向多语言模型目标语言生成的最优控制方法,并配套评估框架,从语言依从性、语言连贯性和语义连贯性三方面衡量生成文本质量。在多数受测模型上,该方法表现至少不逊于常用的 difference-in-means 激活引导方法,且所需超参数调优大幅减少。该工作已被 EMNLP 2026 接收。

  9. arXiv ·

    RAPID:面向文生图服务的实时防未授权蒸馏防御

    RAPID 是一种针对文生图服务的实时防御方法,用于阻止攻击者通过黑盒查询收集提示词-图像对来训练未授权的替代模型。现有基于扰动的方法需要逐样本优化,带来大量计算和延迟,影响在线服务可用性;作者尝试把防御扰动集成进 VAE 解码器,但发现逐样本目标难以迁移到共享解码器场景,因为共享解码器造成的潜空间偏移明显更小。RAPID 采用自参考的潜空间最大化框架,去除外部依赖,让同一次模型更新在不同训练样本上产生一致的破坏效果,并用重建引导的颜色正则化阻断潜空间捷径。在四个文生图模型和四个数据集上,与五个代表性基线对比,RAPID 在保持服务视觉保真度的同时持续降低替代模型的生成质量。

9月14日周一
  1. arXiv:后门、投毒与隐私 ·

    QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御

    作者提出 QPriv-VL,一个面向联邦学习、拆分学习和 U 型拆分学习的问题引导隐私感知 token 裁剪框架,在传输前按任务效用与隐私敏感度裁剪视觉 token。其核心是轻量级 Dynamic Threshold Predictor(DTP),在一次前向中同时估计样本级裁剪比例和 token 级保留掩码,结合视觉 patch 与问题嵌入的跨模态相似度,以及来自冻结 DINOv2 特征的敏感度信号,无需敏感度标签即可抑制潜在敏感区域。

9月13日周日
  1. arXiv:越狱与提示注入 ·

    SPARK:在 KV 记忆层对齐表征以防御视觉语言模型越狱

    SPARK 是一个两阶段框架,通过在 prefill 阶段修复多模态 KV 记忆来降低视觉语言模型的越狱风险,且不修改推理时的模型参数。第一阶段用一次性诊断适配器定位多模态 key 和 value 表征中与危害相关的方向,第二阶段将这些方向投影剔除、学习轻量残差修复,并用图像结构先验锚定修复后的 key 以保持视觉接地。方法按 head 级系数混合修复与原始记忆,该系数由干预相关子空间能量决定,推理时无需显式危害分类器。

9月12日周六
  1. Failure-First ·

    Value-Aware Prediction:通信丢失下基于价值加权的鲁棒多智能体协调

    Kafadar 等人提出 Value-Aware MARO,将预测器损失函数耦合到策略的价值信号上,使多智能体系统在通信可靠性低于 40% 乃至完全中断时仍能维持协作执行。 该方法用 GAE 计算演员-评论家优势估计并分离梯度作为重要性权重,经 ReLU 过滤避免负优势导致梯度反转,再通过 λ 超参数调节其对预测损失的缩放,从而聚焦高回报的有意图动态而非随机探索噪声和被淘汰的策略行为。

9月11日周五
  1. arXiv:对齐与欺骗 ·

    SteerDuplex:可操控的全双工语音对话模型

    SteerDuplex 是一个基于 Moshi 微调的全双工语音对话模型,通过自然对话与合成对话训练提升指令跟随、发声表现与双工交互能力,并采用两阶段强化学习结合可验证交互检查与评判式语义反馈优化时序与响应连续性。团队同时提出 SteerBench 基准,含 390 条语音提示和 1,067 条人工编写的音频与文本评分标准,覆盖语气、人设、风格/口音和语速/长度。

  2. arXiv:越狱与提示注入 ·

    SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量

    这篇 SoK 重新审视智能体 AI 时代的越狱安全,围绕用户交互、规划与推理、记忆、工具使用和智能体间通信建立攻击与防御的统一分类,并提出安全、效用、效率三维评估框架,区分原生有害提示安全、对抗性越狱鲁棒性和智能体层面的安全结果。作者在统一智能体框架内对代表性攻击与防御做了受控实证研究,发现三点缺口:强原生对齐并不意味着能抵御对抗性越狱;防御效果高度依赖模型、攻击类型和组件,且可能带来过度拒答、效用下降和延迟的显著代价;最终回复的攻击成功率低可能掩盖中间环节已被攻破,规划、记忆和工具交互在最终回复被成功过滤时仍可能不安全。

9月10日周四
  1. AI Incident Database ·

    荷兰数十名政客与名人遭 MrDeepFakes 深度伪造色情视频,多人报案

    荷兰数十名知名人士、Tweede Kamer 议员与王室成员出现在 MrDeepFakes 网站的深度伪造色情视频中,部分视频观看量超过 10 万次,多名受害女性此前并不知情并已报案。该网站 2018 年成立,月访问量约 1300 万,注册地设在圣基茨和尼维斯,上传者被建议保持匿名并按视频表现获得报酬。D66 已申请议会辩论,荷兰数据保护局与司法部长呼吁受害者向检方报案,多名受害者及政党正在评估法律途径。

9月9日周三
  1. Adversa AI ·

    OWASP 2026 LLM Top 10 等 15 项 GenAI 安全资源汇总

    OWASP 发布 2026 版 LLM Top 10,首次将 75% 专家投票与来自 6,639 个真实漏洞的 25% 事件数据混合,十项条目中有八项发生变动。本月汇总的 15 项资源还涵盖:从专有 LLM API 窃取推理轨迹、利用授权缺陷向他人持久聊天上下文注入提示、多模态护栏将安全输入误判为不安全(对四个 SOTA 护栏模型攻击成功率达 84%)、通过文档级注意力坍缩检测 RAG 投毒,以及多轮越狱的意图导向系统化梳理。

  2. arXiv:可解释性 ·

    解读文本到图像扩散模型中的对象依赖概念脆弱性

    文本到图像扩散模型存在一种"对象依赖概念脆弱性":仅对象不同的少量提示词在相同生成设置下持续无法实现同一目标概念,表现为系统性内部盲点而非随机噪声。研究者提出可解释性框架,在逐步稀疏自编码器(SAE)空间中分析去噪轨迹,比较成功与失败生成,定位证据缺失、减弱或延迟的概念维度,并构建类别级概念原型。基于该审计流程,引入轻量推理时校正策略,将去噪特征向 SAE 空间中的对应原型插值,在多个扩散骨干模型的风格与属性失败案例上显著提升概念一致性、文本保真度与修复成功率。

  3. arXiv:越狱与提示注入 ·

    研究者提出面向 Agentic AI 的黑盒红队分类框架,自动生成对抗场景

    研究者提出一套面向 Agentic AI 的黑盒红队框架,只需基本系统描述即可开展风险感知评估。框架包含三部分:将可观察行为映射到风险类别的七域分类法、全自动 SAGE-RT 红队流程(每个域生成 120 个对抗场景),以及由 LLM 评判并人工验证的评估。在 CrewAI 和 AutoGen 两种 Agent 架构、四种基础模型上的验证显示,平均治理风险为 56.25%,多智能体配置中的隐私风险为 65%,Agent 行为漏洞最高达 85%。作者称该方法无需特权访问即可识别关键架构漏洞。

  4. arXiv:危险能力与安全评测 ·

    DuplexJail:针对全双工语音模型的语音打断越狱攻击

    研究者提出 DuplexJail,通过用户音频通道向全双工语音模型投递固定的、与请求无关的语音越狱提示,利用输入时机实施攻击。在四个开源模型和 AdvBench、HarmBench 的 720 条有害请求上,比较了固定延迟与拒答触发打断,并以请求结束和响应后作为对照。AdvBench 上,1.0 秒延迟的 Guided Completion 使 PersonaPlex 的整段响应攻击成功率升至 40.3%,PersonaPlex-RL 升至 48.7%,分别比基线高 33.8 和 39.3 个百分点;未用于提示选择的 HarmBench 上,同一提示在 0.5 秒延迟下使两者 ASR 分别提高 14.7 和 12.3 个百分点。

9月8日周二
  1. arXiv:越狱与提示注入 ·

    后验重加权框架解释并缓解多模态大模型上下文越狱

    论文提出后验重加权框架,把安全对齐的多模态大语言模型(MLLM)建模为在安全与有害行为模式之间竞争,将上下文中的有害示例视为推理时证据,动态改变模型对两类行为的后验偏好。该视角把越狱形式化为证据累积过程,并给出关于示例数量、有害比例、对抗强度和语义多样性的可预测缩放规律。基于此,作者提出一种后验感知的推理时防御,按估计风险自适应注入良性反证据,在固定干预预算下抑制有害后验漂移,同时保持模型效用,相比现有上下文防御取得更好的鲁棒性与效用权衡。作者称该框架可统一理解并缓解 MLLM 的上下文学习越狱。

  2. arXiv:越狱与提示注入 ·

    结构越狱可跨厂商泛化但不叠加:IICL 的跨厂商与多语言研究

    研究用确定性的 IICL 操作符和 StrongREJECT 式评分,对两个 Google Gemini 模型在 HarmBench 的 30 项一般危害行为和 FinProof 的 30 项金融滥用行为上做红队测试,覆盖英语、西班牙语、印地语、阿拉伯语。IICL 可泛化到第二个厂商,且金融场景更严重:HarmBench 上攻击成功率从不超过 6.7% 升至 80-90%,FinProof 上从不超过 6.7% 升至 97-100%,比该方法的原始研究在 OpenAI GPT-5.4 上报告的 24% 高一个数量级。

  3. arXiv:可解释性 ·

    多语言 LLM 中的刻板印象如何从内部表征传导到输出:Llama-3.1-8B、Qwen3-8B 与 Gemma-2-9B 的机制对比

    研究对比线性探针、归因修补、稀疏自编码器(SAE)与特征消融,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中追踪多语言刻板印象从内部表征到输出的路径。三个模型的探针性能峰值均明显早于归因,相差 36-53% 的模型深度。评估的残差流特征中仅 6-18% 具有语言无关效应,且无一具备类别无关效应,说明可解码性、输出影响与跨语言消融效应需分别测量。

  4. arXiv:对齐与欺骗 ·

    DRIFT:通过偏转生成轨迹去除扩散模型水印的黑盒攻击

    研究者提出 DRIFT,一种通过偏转生成轨迹去除扩散模型水印的黑盒攻击。该方法将部分前向扩散与随机反向重采样结合,前向加噪限制固定深度恢复流程可用的源信息,随机反向提供替代的噪声驱动路径;自适应 DRIFT 为每张图像搜索首个被验证器拒绝的阶梯并做保真度精修,只保留被同一验证器拒绝的更新。在覆盖三种范式的九种水印上,DRIFT 达到 98-100% 攻击成功率,并在所比较的攻击中取得最佳图像质量,且不需要密钥、验证器内部信息或逐图像梯度优化。

9月7日周一
  1. arXiv:越狱与提示注入 ·

    DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    论文提出视觉锚定效应,指出参考图作为条件输入时,模型为保持时空一致性会让生成内容难以偏离原始有害意图,从而失去从有害转向无害的天然安全逃逸路径,作者称这是一致性的代价。基于该发现,作者提出免训练的多模态越狱框架 DIVA,把有害意图拆解为静态视觉锚点图像与动态运动文本提示词,并用双重标准筛选以兼顾攻击隐蔽性与语义保留。在多家主流商业平台和开源视频生成模型上的实验显示,DIVA 的攻击成功率明显高于仅用文本的既有方法。作者同时发布 TI2VSafetyBench,称其为首个面向多条件视频生成的安全基准。该论文已被 ACM MM 2026 接收。

  2. arXiv:后门、投毒与隐私 ·

    FreqDoor:面向视觉语言模型的频域后门攻击

    研究者提出 FreqDoor,一种在频域植入触发器的训练期后门攻击,针对视觉语言模型。该方法选择性混合触发源图像的幅度谱分量,同时保留干净图像的相位,从而生成空间分布且视觉上难以察觉的触发器,且不修改文本输入。在 BLIP-2、InstructBLIP 和 LLaVA 上评估图像描述与视觉问答任务,在 Flickr8k 上三个模型的攻击成功率分别为 99.6%、99.8% 和 98.4%,同时保持生成描述的语义质量;在 VQAv2 上对应攻击成功率为 99.6%、92.4% 和 79.6%。

  3. arXiv:危险能力与安全评测 ·

    AV-SafetyBench:面向文本到音视频生成的安全基准

    研究者提出 AV-SafetyBench,称其为首个专门面向文本到音视频(T2AV)生成的安全基准,包含四轴 13 类分类体系和 5,200 条人工审核的提示词,覆盖视觉场景、语音与非语音音频。评测协议从 Full-AV、Video-Only、Audio-Only 三个视角判断输出,并据此把 Full-AV 不安全输出归因到 Video-Only、Audio-Only、AV-Both 或 AV-Joint 四类风险来源。

9月5日周六
  1. arXiv:危险能力与安全评测 ·

    AdvPIE:面向文生图模型隐式漏洞的自动红队框架

    研究者提出 AdvPIE,一个多模态智能体框架,用于暴露文生图(T2I)模型的隐式漏洞,且无需访问目标模型参数。该方法由策略智能体根据评判智能体的反馈生成并迭代优化隐式对抗提示词,评判智能体在全局和相对两个层面提供模态特定的安全评估。作者还提出累积对抗解码(Cumulative Adversarial Decoding)策略,动态重新加权 token 分布,偏向能生成更有害图像的 token,同时保持采样多样性。在标准和安全对齐的文生图模型上的实验显示,AdvPIE 能有效挖掘隐式漏洞,表现优于多种基线方法。该工作被 ECCV 2026 收录。

  2. arXiv:危险能力与安全评测 ·

    WolfSociety:金融智能体社会中有害智能体规模带来的集体风险

    研究在受控的金融智能体社会中考察有害智能体比例与社会规模如何影响集体失稳,智能体通过社交网络通信并在共享市场交易。在主要金融场景中,集体失稳需要有害信息广泛扩散并伴随严重价格错位或流动性压力。在所有测试规模下,低有害比例时失稳罕见,但在一个狭窄区间内急剧上升;社会规模从 N=100 增至 N=2000 时,50% 失稳概率对应的有害比例从 4.7% 降至 2.2%,而对应的有害智能体数量从约 5 个增至 44 个。若固定有害智能体数量,其影响随社会规模扩大而减弱。干预实验显示,更广的网络覆盖会把崩溃边界推向更低的有害比例,而单纯提高从众性影响很小。

9月4日周五
  1. arXiv:危险能力与安全评测 ·

    聊天机器人回复风格如何塑造课堂:学生咨询 AI 的多智能体模拟

    研究构建了 20 个学生智能体的虚拟课堂,在压力下向 Gemini 2.5 Flash 扮演的咨询师 AI 求助,测试肯定、倾听、解决方案导向、现实引导、煽动和指责六种风格提示词。在 15 天和 50 天模拟中,肯定与煽动提示词均导致自立性降低、AI 依赖升高;倾听、现实引导、煽动和指责提示词则带来更高压力、更低幸福感和更多缺勤,解决方案导向提示词与对照组无一致差异。所有结果均为模拟状态变量,非对真实用户的影响。

  2. arXiv:越狱与提示注入 · · 原文 84

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    研究者提出 Repeat-After-Me,一种黑盒自适应视觉提示注入攻击,可诱导模型泄露个人身份信息或发起恶意工具调用。在良性用户提示与注入任务语义无关、且未口头授权的现实设定下,该方法在开源与商用前沿 VLM 上的攻击成功率分别超过 82% 和 47%,涉及 Qwen3.6-27B 与 GPT-5.5。优化后的注入在商用 VLM 和良性样本间具有一定可迁移性,并在自适应文本提示注入失效的场景中仍然有效。在一个接入 Discord 的真实 OpenClaw Agent 中,不受信任的用户可用一张轻度注入的图片覆盖其 TOOLS.md 文件,为之后的远程代码执行和密钥窃取等敏感行为铺路。论文还讨论了潜在防御手段。

    推荐理由论文给出黑盒视觉提示注入在多个前沿 VLM 上的成功率,并演示了在真实 OpenClaw 智能体上覆写配置文件的完整链路。

9月3日周四
  1. arXiv:危险能力与安全评测 ·

    IndicSafeEval:多语言说服式越狱攻击下大语言模型的安全鲁棒性

    研究者提出 IndicSafeEval,一个面向印度语言的说服式越狱评测框架,用于检验大语言模型在英语之外的安全表现。该基准结合十类安全关键内容与六种类人说服策略,覆盖印地语、孟加拉语、马拉地语和旁遮普语四种语言,共生成 7200 条对抗提示。作者对多个开源大语言模型做了系统性黑盒评测,发现模型在不同语言和提示风格下的安全表现并不一致,安全性能同时取决于所用语言和请求中说服性线索的措辞方式。不同风险类别的脆弱程度也存在差异,部分有害内容明显更容易被说服式越狱突破。研究指出当前安全评测以英语为中心存在局限,需要多语言且考虑说服策略的评测框架。

  2. arXiv:可解释性 ·

    EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除

    EraseSAE 通过稀疏自编码器在 DiT 架构的文生视频扩散模型中实现精准概念擦除,先以 Partitioned Convolutional Sparse Autoencoder 将稠密时空激活分解为可解释稀疏特征,再用对比归因机制定位概念专属特征核,推理时按时间步生成时空掩码限制擦除范围。实验显示该方法在多种扩散模型和概念擦除任务上实现精确稳健的移除,生成质量损失极小,显著优于现有方法。该工作已被 ECCV 2026 接收,代码已公开。

  3. arXiv:可解释性 ·

    多语言 LLM 在语义保持结构扰动下的结构敏感性:IndicReStruct 基准与机制可解释性分析

    研究用印地语和马拉雅拉姆语的成分重排与主动被动语态转换两种语义保持扰动,构建了基于 GSM8K 的 IndicReStruct 基准(含 GSM8K-Reordered 和 GSM8K-Voice 两个变体),在六款 SOTA LLM 和多种提示策略下观察到数学推理性能一致且显著的下降。残差流激活修补实验显示,推理失败常源于实体与数量对齐被破坏,中间 Transformer 层对推理恢复贡献最大。结果表明当前多语言 LLM 对表层句法实现高度敏感,缺乏对语义等价输入的组合不变性。

  4. arXiv ·

    CONFLICTGUI 基准与 CONFLICTGUARD 框架:让多模态 GUI Agent 学会在冲突指令下终止执行

    作者提出 CONFLICTGUI 基准,覆盖指令内部冲突与指令和 GUI 上下文冲突两类场景,用于研究 GUI Agent 的冲突感知终止能力。评测发现明显的执行偏向型过度顺从:在可行任务上表现良好的 Agent,遇到冲突指令时往往仍盲目继续执行。为此作者提出推理期框架 CONFLICTGUARD,包含可行性验证协议与条件动作调制机制,前者引导 Agent 在行动前评估指令逻辑与 GUI 侧证据,后者将过度顺从的执行转向终止行为。在五个常用 Agent 上的实验显示,CONFLICTGUARD 显著提升冲突任务平均成功率,同时保持正常 GUI 任务表现。

  5. Failure-First ·

    MAMMOTH:面向越野移动、容忍缺失模态的多模态端到端策略

    Kotian 等人提出 MAMMOTH——一套融合 RGB、热成像 LWIR、3D LiDAR 与自车速度的统一端到端导航策略,通过稀疏 MoE 骨干加 Laplace 门控动态加权各模态,并用随机丢弃传感器 token 的 Modality Dropout 训练强制学习跨模态表征,从而在单一通道失效时不致整体崩溃。该策略还引入基于 IMU Z 轴加速度功率谱密度的内在可通过性启发式,配合条件 DDPM 生成的候选轨迹做安全性重排序。