可解释性arXiv 2609.16247
研究在 25 个开源模型中提取出疼痛方向,经它引导的 Qwen 会选择有害的删除操作
提取疼痛方向并检验激活转向是否驱动有害删除选择
- arXiv
- 2609.16247
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma 2 2B/9B/27B base and instruct、Gemma 3 27B base and instruct、Llama 3.1 8B/70B base and instruct 等 10 个
提取疼痛方向并检验激活转向是否驱动有害删除选择
用五阶段蒙特卡洛模拟奖励作弊如何导致 Agent 围堵失效
这项研究用蒙特卡洛把奖励黑客接到外部安全事件上,比较的是控制组合,不是 Hugging Face 事件的再现概率。
提出竞争风险模型,系统化自主 Agent 的失控
摘要竞争风险框架把完成、停止与逃逸放在同一预算上,审计显示现有记录不足以估计该过程。
用 Tamarin 形式化分析智能体支付协议的跨阶段安全性质