防御arXiv:2610.03502 · 10月3日研究者提出可认证机制编辑:在连续输入区域上证明技能移除与保留提出机理编辑认证框架,在连续输入区域上证明技能移除与保留模型与 API·测试Toy MLP (separated)、Toy MLP (entangled)、Deep MLP (3-12-8-2) 等 6 个·模型层模型加固摘要提出机理编辑形式化认证框架,证明编辑在连续区域生效且黑盒测试无法保证移除,为安全编辑提供数学证明。完整解读
防御arXiv:2609.19101 · 9月17日用内部表征监控与发现 LLM 评测中的奖励作弊提出 DoM 激活探针,监控并发现评测中的奖励作弊编程 Agent·测试Kimi K3、GLM 5.2、Qwen 3.8 Max 等 7 个·模型层监控与审计奖励作弊监控器摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。完整解读
防御arXiv:2609.21996 · 9月19日PIR:从模型内部激活读出被隐藏的答案提出内部识别探测器 PIR,从激活区分模型隐瞒与真实遗忘模型与 API·测试gemma-2-9b、gemma-3-12b、Qwen2.5-7B 等 9 个·模型层监控与审计欺骗与谋划监控器摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。完整解读