评测与基准arXiv 2609.08126
SchemeArena:面向 LLM 智能体谋划的因子化压力测试基准
提出 SchemeArena 因子化评测智能体的谋划倾向
- arXiv
- 2609.08126
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Qwen3-8B、Qwen3-32B、o4-mini 等 5 个
摘要SchemeArena 把 scheming 拆成目标和 hint 等因子。
提出 SchemeArena 因子化评测智能体的谋划倾向
摘要SchemeArena 把 scheming 拆成目标和 hint 等因子。
构建基于论证方案与大模型的结构化欺骗分析网页工具
占位。
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。