评测与基准arXiv 2610.03585
宾州州立大学提出 TPRS,量化 Agent 安全基准中工具命名对 ASR 的影响
提出 TPRS,量化工具命名等表征变化对智能体安全基准得分的影响
- arXiv
- 2610.03585
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-5-mini、Claude Haiku 4.5、GPT-4o-mini
提出 TPRS,量化工具命名等表征变化对智能体安全基准得分的影响
提出自演化基准 ActBench,评测协作智能体的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全