风险行为arXiv 2606.20023
ToolPrivBench:LLM Agent 在低权限工具足够时仍倾向选择高权限工具
构建 TOOLPRIVBENCH 评测 Agent 的过度特权选择并提出特权感知后训练
- arXiv
- 2606.20023
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Kimi K2.5、Qwen3-8B、LLaMA-3.1-8B 等 15 个
- 防御模型加固
- 风险Agent 危险操作
摘要TOOLPRIVBENCH 显示过度特权选工具普遍,常规对齐迁移有限,特权感知后训练可降低 OPUR。
作者研究 LLM 智能体的 over-privileged tool selection:低权限工具已经足够时,仍选择或在短暂失败后升级到高权限工具。