分析与理论arXiv:2610.09667 · 10月7日东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核揭示推理模型用标识符规则替代随机抽样,使审计可被预测模型与 API·测试GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个·模型层推理链摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。完整解读
分析与理论arXiv:2610.01535 · 10月1日论文:安全路由评测在分布偏移下失效,基线选取偏差被低估分析分布偏移下安全路由评测的基线选择偏差与虚假下限LLM 应用·测试claude-3-5-sonnet、claude-3-opus、claude-sonnet-4-6 等 12 个·应用层越狱+1+1摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。完整解读
分析与理论arXiv:2609.32717 · 9月26日研究揭示语义保持变换下的 LLM 对齐与效用不对称用语义保留变换探针比较效用与对齐在分布偏移下的稳定性模型与 API·测试Llama3-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 等 10 个·模型层拒答失当摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。完整解读