东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
另有 1065 篇论文还没打上分类标签,暂不在筛选结果里。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
论证 Lean 编译通过不能保证自然语言数学证明语义忠实
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
分析激活引导去偏方向,发现其编码的是置信度而非公平性
揭示类型化决策模型按选项标签而非定义规则作答
提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。
证明短开头词可唤醒基模型推理,且效应来自训练数据
完整解读揭示无触发虚假训练下事实回答与下游决策的审计差距
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
用几何投影与因果交换干预,分析拒绝机制读取的道德表征
本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。
用消融与转向干预审计稀疏自编码器特征的因果有效性
提出匹配比较校准,界定生成训练序列何时算可抽取记忆
Cooper 等人从第一性原理重写 extractable memorization:生成训练文本只有在概率高过匹配非训练文本的可预测性基线时,才支持记忆声称。
用聚合与区分效度检验基准是否衡量其所称概念
完整解读提出 TAME 框架,定位并验证驱动涌现失准的回复 token
用探针与激活导向分析语言模型的评测意识表征及言语化
提出因果可解释性仪器校准规程,识别决策位点测量失效
比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何
作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。
提出 Persistent SAE,为语言模型特征学习特定时间尺度
占位。