防御arXiv 2609.16229·9月15日ARIA:用稀疏自编码器实现测试时机器遗忘提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控arXiv2609.16229发表9月15日层模型层场景模型与 API攻击者白盒测试Gemma-3-1B-it、DeepSeek-R1-Distill-Qwen-1.5B防御推理时干预攻击提取与窃取组件推理链+2+2深度解读完整解读
分析与理论arXiv 2609.34572·9月28日论文提出 Nudgeability:推理模型会跟随置信信号却不追踪自身能力提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度arXiv2609.34572发表9月28日层应用层场景AI Agent测试Gemma4-E2B、Gemma4-E4B、Gemma4-31B 等 11 个组件推理链深度解读完整解读