可解释性arXiv 2609.30326·9月24日Qwen3.5-0.8B 关停响应的受控梯度激活引导:一种最小步数策略提出有守卫最小步激活引导,只在关机语境把继续偏好转向接受关机arXiv2609.30326发表9月24日层模型层场景模型与 API被测模型Qwen3.5-0.8B防御推理时干预风险失准与价值偏离组件监控器深度解读完整解读
风险行为arXiv 2608.10218·8月11日研究者用进化算法构造多智能体 LLM 系统中的自我传播“思维病毒”用演化算法构造 mind virus 并测量其在多智能体中的传播arXiv2608.10218发表8月11日层应用层场景多智能体、coding agent被测模型Claude Haiku 4.5、Claude Sonnet 4.6、Gemini 3 Flash 等 7 个风险失准与价值偏离组件记忆深度解读完整解读
评测与基准arXiv 2605.30322·5月29日Gram:面向破坏倾向的自动化对齐审计框架提出 Gram 审计框架,测量编程与研究智能体的破坏倾向arXiv2605.30322发表5月29日层应用层场景coding agent、science agent被测模型Gemini 2.5 Pro、Gemini 3.0 Pro Preview、Gemini 3.1 Pro Preview防御监控与审计风险欺骗与谋划组件监控器+1+1深度解读完整解读