审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度
开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
另有 757 篇还没有研究类型,暂不在这些分类里。
开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
论证 Lean 编译通过不能保证自然语言数学证明语义忠实
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
提出 IEC 协议与 IntAct,定位并修复工具调用执行路径的静默篡改
分析激活引导去偏方向,发现其编码的是置信度而非公平性
分析检索智能体判定结果无用后仍不停止检索的整合失败
本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。
提出 AgentSpy,在系统调用层观测编程智能体并检测技能注入攻击
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
揭示类型化决策模型按选项标签而非定义规则作答
揭示检索生成中文本水印诱发事实幻觉的机制并提出 FPTI 与 FPAI 干预
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。
证明短开头词可唤醒基模型推理,且效应来自训练数据
完整解读用 J-lens 检测屈从多数的智能体是否仍表征原前提
揭示无触发虚假训练下事实回答与下游决策的审计差距
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
形式化跨不可关联身份的分解攻击,并证明状态化防御的效用边界
完整解读用几何投影与因果交换干预,分析拒绝机制读取的道德表征
本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。
用消融与转向干预审计稀疏自编码器特征的因果有效性