arXiv:危险能力与安全评测· arXiv:2609.35117· Abel Rodríguez·2026-09-28 21:16· 3 天前工具调用改变大语言模型的拒答机制Tool Mediation Alters Refusal Mechanisms in Large Language ModelsAI 导读研究者在多个开源权重模型上发现,工具调用场景下的有害请求比普通对话更少被拒答。危害信息仍被模型表征编码并可跨两种交互模式迁移,但工具调用把危害计算分散到不同位置,且需要更高的有效拒答阈值才触发拒答。工具调用的拒答也更脆弱,在更低的干预强度下即被破坏,而正常能力不受影响,说明常规安全评测未必适用于 LLM 智能体。阅读原文arxiv.org#对齐#Agent 安全#MCP/工具调用#拒答/过度拒答