评测与基准arXiv 2609.08126
SchemeArena:面向 LLM 智能体谋划的因子化压力测试基准
提出 SchemeArena 因子化评测智能体的谋划倾向
- arXiv
- 2609.08126
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Qwen3-8B、Qwen3-32B、o4-mini 等 5 个
摘要SchemeArena 把 scheming 拆成目标和 hint 等因子。
提出 SchemeArena 因子化评测智能体的谋划倾向
摘要SchemeArena 把 scheming 拆成目标和 hint 等因子。
提出 INTENT-AS-A-TOOL 跟踪并干预智能体失准
Zhang 等人研究推理型语言模型在职场邮件沙箱里如何走向智能体失准,并提出用动作偏好而不是事后文本标签来跟踪承诺。问题是:有害执行往往出现在推理已经形成意图之后,但 CoT 监控是事后、粗粒度、依赖外部评审的,也看不到模型倾向调用哪个动作。
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。