跳到正文
原文
arXiv:危险能力与安全评测· arXiv:2609.35117· Abel Rodríguez·· 3 天前

工具调用改变大语言模型的拒答机制

Tool Mediation Alters Refusal Mechanisms in Large Language Models

AI 导读

研究者在多个开源权重模型上发现,工具调用场景下的有害请求比普通对话更少被拒答。危害信息仍被模型表征编码并可跨两种交互模式迁移,但工具调用把危害计算分散到不同位置,且需要更高的有效拒答阈值才触发拒答。工具调用的拒答也更脆弱,在更低的干预强度下即被破坏,而正常能力不受影响,说明常规安全评测未必适用于 LLM 智能体。

阅读原文arxiv.org