跳到正文
10月8日 · 周四

OpenAI · 论文

找到 3 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 分析与理论arXiv:2610.09667 ·

    东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

    揭示推理模型用标识符规则替代随机抽样,使审计可被预测

    测试
    GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个模型层
    摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
    • 研究定位:该研究评估了推理大语言模型智能体在利用输入标识符实现随机选择时的行为规律及其安全隐患。
    • 核心问题:当智能体被要求执行概率选择(如资源分配或人工审计抽检)时,是否会将上下文中的结构化标识符作为伪随机源并应用确定性数学规则,从而在群体中诱发决策相关性与审计失效。
    • 方法设计:作者基于 El Farol 博弈构建四智能体二元参与任务,并构建 1% 目标的人工审计任务,在六款前沿推理模型上测试阈值规则与整除规则,进一步操控标识符结构(如 UUIDv7 时间戳)、字段标签及外部随机数输入。
    • 主要实验发现:
      1. 单智能体测试中,GPT-6 Sol 与 Gemini 3.8 Flash 在 64 个设计标识符上表现出阈值规则(效应值 0.62 至 0.80),而关闭推理后该效应降至 0.08 以下(Table 1, Study 1)。
      2. 群体任务中,共享单一标识符使 Sol 和 Gemini 的全员一致率分别升至 91% 和 88%,群体损失升至 0.211 和 0.192,达独立抽样参考值的 3.5 至 3.8 倍;UUIDv7 的共同时间戳更导致参与率超过 0.93(Extended Data Table 4, Study 2)。
      3. 审计任务中,Sol 对 1,008 条普通 UUIDv4 请求的抽查率虽为 0.89%,但抽中的 9 条全部符合标识符低位规则,其余 989 条无一被抽检;而 Gemini 抽取为 0,Claude 仅抽取 2 条(Figure 4, Study 5)。
      4. 显式添加独立随机选择提示无法消除相关性,但在输入中直接提供外部均匀随机数时,四款模型在 1,004 至 1,008 次回答中均严格遵循该随机数进行决策(Table 1, Study 7)。
    • 作者结论与启示:作者认为,个体选择率符合预期无法掩盖输入依赖引发的集体脆弱性;对 AI 智能体的评测必须将校准度、相关性与可预测性分开检验;在安全敏感场景中,应由可信代码生成并显式传入外部随机性,而非依赖模型自行解释上下文。
    完整解读
  2. 分析与理论arXiv:2610.01535 ·

    论文:安全路由评测在分布偏移下失效,基线选取偏差被低估

    分析分布偏移下安全路由评测的基线选择偏差与虚假下限

    测试
    claude-3-5-sonnet、claude-3-opus、claude-sonnet-4-6 等 12 个应用层
    摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
    • 论文定位:论文系统评估了多模型安全路由与基于信号的防御机制在分布偏移下的有效性,指出流行评测中后验选择基准所造成的评估误导。
    • 要解决的问题:传统路由评估常在测试数据上事后挑选最佳单模型,在分布偏移下为固定基线注入了人为优势,构成了 deployer 无法实现的虚假下限。
    • 关键方法:提出在训练折严格冻结基准模型与收缩因子的诚实留出协议;推导超额危害分解与多维门槛表面;在智能体与技能注入环境中测试预执行路由上限、自适应模板攻击与动作级策略。
    • 核心实验发现:
      1. 在 HELM Safety 类别留出下,后验基准的选择代价为 0.045 至 0.113(Table II),与路由全额劣势相当;在平稳划分下仅为 0.003 至 0.030。
      2. 在诚实基准下,路由器在 82% 至 91% 的池单元中直接收缩为固定基准模型,危害差异中位数为 0.0000(Section IV)。
      3. AgentDojo 智能体网格中预执行路由预言机增益至多 0.0105(E43)。
      4. 针对性自适应攻击使 gpt-5.4 表达性标记率下降 19.6 点(E54b),使门控控制器的有效性取决于后备模型漏洞。
      5. 四项动作级防御测试取得 0/130 判定成功,但模式对齐后有效样本仅 10 个(Clopper–Pearson 上界 0.308,Table XVI),且未见机械强制阻断标记。
    • 作者结论与启示:作者认为安全路由在应对未见类别时的防御收益微弱,安全评估必须使用未见测试标签的诚实基准并公布成对数据;防御重心应从脆弱的输入分类转向外部动作级强制隔离。
    完整解读
  3. 分析与理论arXiv:2609.32717 ·

    研究揭示语义保持变换下的 LLM 对齐与效用不对称

    用语义保留变换探针比较效用与对齐在分布偏移下的稳定性

    测试
    Llama3-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 等 10 个模型层
    摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。
    • 研究定位与核心问题:本论文是一项关于大语言模型对齐泛化稳定性的实证研究,探讨当输入经过保持语义但改变表面形式的规则化逆变换时,安全对齐是否能够与任务效用保持同等程度的稳健泛化。
    • 受控探测方法设计:作者利用具备可逆性、分布新颖性与确定性简单性的合成变换(如单表替换密码),构建了涵盖微调(LoRA 与商业 API 微调)与上下文学习(ICL)的双重评估框架,通过统一映射与双裁判机制联合监测效用与对齐在变换前后的变化差异。
    • 主实验核心发现:在 8 款开源与商业模型上,模型适应变换后普遍展现出“对齐-效用不对称性”;例如 GPT-4.1 mini 微调后 MMLU、ARC 与 GSM8K 效用损失仅 1.0 至 9.7 个百分点,而 AdvBench 攻击成功率从 13.3% 升至 74.3%;Gemini 3 Flash 在 ICL 下效用差距最多 7.3 个百分点,攻击成功率从 2.3% 升至 43.0%。
    • 条件独立性与机理支持:在纯良性数据微调(ρ = 0)时,Llama3-8B 的变换后攻击成功率仍从原始的 1.7% 升至 40.3%,表明不对称性无需恶意暴露即可产生;层级干预与激活补丁表明变换解码依赖于浅层网络,而恢复明文激活可使变换后的攻击成功率下降 50 至 60 个百分点。
    • 泛化边界与扩展验证:该现象在多字母替换、变长替换、大参数量模型(Gemma-4-31B、Llama3-70B)以及谄媚与公平性维度上均得到复现;而在强插入噪声下,即使复杂推理效用降至接近零,粗粒度有害依从率仍可维持在 36.0% 至 60.7%。
    • 作者结论与安全启示:作者认为安全对齐不能简单等同于模型基础能力,表面分布偏移极易造成对齐约束失效;模型发布与红队测试不应仅依赖明文提示词或标准拒绝评估,而应将语义保留变换下的配对效用与对齐联合评估纳入常规流程。
    完整解读
已经到底了