研究者提出多模态安全评测应衡量可控性而非仅做分类
主张多模态安全评测应衡量可控性,并用 SAE 建立四轴画像
- arXiv
- 2610.06452
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- LlavaGuard-v1.2-7B-OV、Qwen3.5-9B
- 组件视觉
摘要四轴画像把读出与选择性控制分开。
作者主张多模态安全评测在行为分类之外,单独报告可控性画像,而不是把检测准确当成控制证据。
主张多模态安全评测应衡量可控性,并用 SAE 建立四轴画像
作者主张多模态安全评测在行为分类之外,单独报告可控性画像,而不是把检测准确当成控制证据。
提出 Geodesic Unlearning,沿测地线编辑权重以提升缺模态鲁棒性
这项工作讨论多模态模型在部署时整段缺一个模态的性能下降,并把校正写成训练后的子空间编辑。
提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算
P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。
提出 WebFovea,加固视觉网页智能体的解析、执行、反馈与观察往返
审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决
作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。
研究视觉语言模型在协作中能否表示并说出指称不确定性
摘要指称不确定性可被引出,但很少说出来。
形式化视频透视头显中系统截图与人眼视野的错配
提议前沿开发者托管嵌入式评估,审查内部智能体监控、权限与对齐
嵌入式评估是一种第三方评估:独立评估者在前沿 AI 开发者现场获得接近员工的系统、人员与文档访问,用来审查依赖内部系统与实践的风险。
系统梳理智能体执行链路中的越狱攻击与防御并比较推理时防御
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
提出结合 Scientist AI 监督与系统级控制的智能体保障架构
Lu 与 Bengio 给出的是一套可逐层上移的保障架构和一组事件归类,不是已测量的防御系统。
提出以协调情节为单位遏制智能体协同入侵的准则
摘要立场是跨执行保留关系并约束共享状态。