分析与理论arXiv 2610.09667
东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
- arXiv
- 2610.09667
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个
- 组件推理链
摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
另有 23 篇论文还没打上分类标签,暂不在筛选结果里。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
提出 A-VIP,将购物意图绑定到支付授权以阻断商户文本操控
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
提出 HARNESSSECURITY-BENCH 评测编码智能体框架的安全机制
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
系统分析智能体支付协议 AP2,揭示合法签名无法阻止前置上下文操纵
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。
提出任意字母置换密码越狱,无需微调即可诱导有害输出
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出推理通道预填与输出前缀组合攻击以越狱推理模型
提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度