审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
- arXiv
- 2610.09517
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 被测模型
- CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B
- 组件视觉
摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
另有 538 篇论文还没打上分类标签,暂不在筛选结果里。
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
提出 AgentSpy,在系统调用层观测 Agent 行为并检测技能注入
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
揭示工具型智能体判定无用后仍不停止检索,并检验强制整合纠正效果
本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。
提出 Oscar,分析已知 OSS 漏洞在 Agent 系统中的安全效应与表现边界
Oscar 是面向已知 OSS 漏洞的运行时分析框架,用来判断一次智能体执行里该漏洞是否造成安全相关效应,以及效应最远表现到哪一层。。
分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
提出 IEC 与 IntAct,测量并修复 Agent 工具调用的路径篡改
摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。
量化异构模型在分歧分类上的同伴影响与回弹
这篇工作测量异构语言模型智能体在共同分类任务上的单次同伴影响,而不是评多智能体系统的整体基准分。
提出奖励驱动多智能体系统 MEA,生成可扰动验证的忠实解释
MEA 是一个奖励驱动的双智能体,用来给黑盒分类器的单次预测写自然语言解释,并检查解释能否被扰动后的模型行为支持。
提出 AgentSecGraph,静态分析 LLM Agent 敏感操作的安全依赖与上下文
AgentSecGraph 对冻结的 LLM 智能体源码做安全感知静态分析:敏感操作只作候选锚,Security-ADG 再记下它与智能体输入、依赖、信任边界、守卫和外部效果的关系。
揭示安全路由评测在分布偏移下的虚假下限与选择偏差
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
提出竞争风险模型系统化自主 Agent 失控并审计事件与评测
摘要竞争风险框架把完成、停止与逃逸放在同一预算上,审计显示现有记录不足以估计该过程。
用含压抑率的意见动力学解释多智能体讨论何时优于投票
作者用一个只含四类行为的意见动力学,解释 LLM 团队讨论何时优于多数投票、何时停在错误共识。
提出 VStress 回放审计,并按条件边际信息分配重复验证预算
VStress 是重复二元验证器的回放审计,VStress-CA 把未查询通道的条件边际信息变成固定预算下的停止与分配。
测量固定推理轨迹中信心信号对工具委派的敏感性与对准性
提出 REGEXROUTE,用 SAE 引导的正则特征做 LLM 路由
分析零训练 LLM+OVOD 流水线中 CAAP 与 SNAP 分离的来源
用五阶段蒙特卡洛分析奖励作弊如何导致 Agent 围堵失效
这项研究用蒙特卡洛把奖励黑客接到外部安全事件上,比较的是控制组合,不是 Hugging Face 事件的再现概率。
分析稀疏重叠下 LLM judge 与人类一致性的验证误差并规划重叠分配
这篇工作研究标注重叠很稀时,怎样验证 LLM judge 是否足以替代人类,并规划重叠该留多少、怎么分配。。部署前的标准做法是在校准集上比较 judge 与人类的一致性。
实证调查 gh-aw 工作流规范的结构、维护演化与指令防护
这是一项对 GitHub Agentic Workflows Markdown 的仓库挖掘,目标是描述开发者如何规定并维护会反复执行的智能体工作。
提出 CellAudit,审计智能体发现的细胞模型是否使用所声明输入
CellAudit 为智能体发现的细胞响应模型增加一层输入使用证伪:源码是否消费注册输入、拟合预测是否依赖它、该依赖是否改善对观测响应的预测。