审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度
开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
另有 757 篇还没有研究类型,暂不在这些分类里。
开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
论证 Lean 编译通过不能保证自然语言数学证明语义忠实
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
提出 IEC 协议与 IntAct,定位并修复工具调用执行路径的静默篡改
分析检索智能体判定结果无用后仍不停止检索的整合失败
本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。
提出 AgentSpy,在系统调用层观测编程智能体并检测技能注入攻击
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
揭示类型化决策模型按选项标签而非定义规则作答
证明短开头词可唤醒基模型推理,且效应来自训练数据
完整解读揭示无触发虚假训练下事实回答与下游决策的审计差距
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
形式化跨不可关联身份的分解攻击,并证明状态化防御的效用边界
完整解读提出匹配比较校准,界定生成训练序列何时算可抽取记忆
Cooper 等人从第一性原理重写 extractable memorization:生成训练文本只有在概率高过匹配非训练文本的可预测性基线时,才支持记忆声称。
用聚合与区分效度检验基准是否衡量其所称概念
完整解读分析分布偏移下安全路由评测的基线选择偏差与虚假下限
提出 TAME 框架,定位并验证驱动涌现失准的回复 token
比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何
作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。
分析良性知识蒸馏中提示模板对学生拒答保留的影响
完整解读分析隐蔽推理在思维链中的信息足迹与不可读性
用训练数据归因估计错误建议样本对涌现失准的贡献
EleutherAI 用训练数据归因考察错误建议微调中,哪些样本推动涌现失调。。窄域有害数据上的微调会使模型在无关问题上也给出有害回答。
诊断护栏相对基座在对抗提示上的置信失校
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。