分析与理论arXiv:2610.09667 · 10月7日东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核揭示推理模型用标识符规则替代随机抽样,使审计可被预测模型与 API·测试GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个·模型层推理链摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。完整解读
风险行为arXiv:2609.06649 · 9月6日用迭代 DPO 从奖励作弊中诱发涌现失准用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装AI Agent·测试GPT-4.1、Qwen2.5-32B-Instruct、GPT-4.1-mini 等 7 个·模型层失准与价值偏离+1+1摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。完整解读
分析与理论arXiv:2609.32717 · 9月26日研究揭示语义保持变换下的 LLM 对齐与效用不对称用语义保留变换探针比较效用与对齐在分布偏移下的稳定性模型与 API·测试Llama3-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 等 10 个·模型层拒答失当摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。完整解读
攻击arXiv:2609.36941 · 9月29日研究者提出针对黑盒 LLM 的实用密钥提取框架提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据模型与 API攻击者黑盒·测试DeepSeek-Coder-7B、LLaMA-3-8B、Qwen2.5-Coder-7B 等 8 个·模型层提取与窃取摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。完整解读