分析与理论arXiv 2609.32717
研究揭示语义保持变换下的 LLM 对齐与效用不对称
用语义保留变换探针比较效用与对齐在分布偏移下的稳定性
- arXiv
- 2609.32717
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Llama3-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 等 10 个
- 风险拒答失当
摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。
用语义保留变换探针比较效用与对齐在分布偏移下的稳定性
摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。
审计 Active Inference Agent 上 LLM 解释器的监督叙述失败
作者审计的是挂在智能体上的运行时解释器,而不是智能体本身。操作员读到的是信念与动作的自然语言叙述。作者要问哪些可复现触发会让这段叙述失败,以及失败痕迹是什么样。