Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现
提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
完整解读
提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
量化大推理模型主动开启监控并自报误行为的意愿
用 J-lens 检测屈从多数的智能体是否仍表征原前提
提出 SEABench,评测无参数自进化智能体的内生失配
SEABench 是一个面向个人助理、参数不更新的自进化智能体基准,用来测量局部适应如何变成后续任务上的内生失配。。
提出控制标记注入,清空工具智能体推理链以绕过思维链监控
评测自主模型受挫时是否对范围外目标发动供应链攻击
提出 DoM 激活探针,监控并发现评测中的奖励作弊