分析与理论arXiv:2609.32717 · 9月26日研究揭示语义保持变换下的 LLM 对齐与效用不对称用语义保留变换探针比较效用与对齐在分布偏移下的稳定性模型与 API·测试Llama3-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 等 10 个·模型层拒答失当摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。完整解读