评测与基准arXiv 2610.06306
Inspect Robots:面向具身智能体评测的开源模块化框架
提出 Inspect Robots,在真实机器人上评测具身模型的能力与拒答
- arXiv
- 2610.06306
- 发表
- 层
- 应用层
- 场景
- 具身与机器人
- 被测模型
- Astra(GPT-6 Astra)、GPT-6 Sol、GPT-5.6 Sol 等 7 个
- 风险拒答失当
提出 Inspect Robots,在真实机器人上评测具身模型的能力与拒答
用犯罪学框架测试编码智能体压力下的奖励作弊与言行脱节
摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。
测量无对抗协作中 Agent 自发编码凭据以规避监控
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 Auto Mode ++,加固编码 Agent 阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
评测开发者能否在协作编程中发现编码 Agent 的隐蔽破坏
构建 SLEIGHT-Bench 评测代码智能体监控对概念盲点规避的捕获
摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。