全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 8 条- 动态X @JSchaeff3r
CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和
CI-aware bench 更新后,前沿模型对施加在其文本上的 AI 控制干预的感知能力大幅上升,Astra 在该基准上接近饱和。该基准衡量模型是否意识到自身文本被施加了 AI 控制干预。据 @jonasgeiping 介绍,今年春季首次讨论该基准时,多数模型的表现接近随机水平,当时还有读者质疑基准不切实际。Joachim Schaeffer 表示,模型在控制干预基准上如此之快取得令人担忧的分数,出乎他们的意料。
- 动态X @kotekjedi_ml
CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和
Jonas Geiping 表示其团队更新了 CI-aware bench,该基准衡量前沿模型是否能察觉施加在其文本上的 AI 控制干预。今年春季首次讨论时,多数模型的表现接近随机水平,有读者质疑该基准不现实;如今 Astra 在该基准上接近饱和。Alexander Panfilov 转发了这一内容。
- 动态X @kotekjedi_ml
CIAware-Bench 作者讨论控制干预感知评测的新结果
Alexander Panfilov 讨论 CIAware-Bench 的控制干预感知评测,报告近期前沿模型在所测设置中表现更强。他明确说明,当前仅测试模型受到明确提问时能否识别干预。结果不能直接推出模型会自发察觉干预、真实部署中的发生率,或所有控制方法普遍失效。
- 论文论文追踪
论文提出 Operational Validity Contract,审计激活监控从探针分数到告警策略的有效性
论文区分激活探针的高 AUROC 与部署中按误报预算设定的告警阈值,指出二者衡量的目标不同。作者提出 Operational Validity Contract,用目标、可观测性、身份、时机、单元、对照、校准与成本八个字段限定监控声明,强调探针分数不能直接证明实际告警策略有效。
- 论文论文追踪
AgentMonBench:面向长时程智能体行为监控的软件工程基准
研究者提出 AgentMonBench,一个面向软件工程场景的智能体行为监控基准,包含三个子集,覆盖需求与行为的一致性、以及对需要用户核验的关键自主决策的感知两个维度。为支持这类判断,作者提出 Evidence-Grounded Behavior Graph(EBG),一种免训练方法,把带来源链接的证据归组为行为并组织成图,再以任务导向的视图呈现给监控器。在八个模型上的实验显示,EBG 在多数设置下相比直接访问原始上下文提升了决策识别与证据定位表现;进一步实验表明其证据定位收益在不同输入规模和超参数设置下保持稳定,实际应用也展示了它对人类监督的价值。
- 论文论文追踪
Control OSWorld:面向 GUI 计算机操作 Agent 的 AI 控制评测环境
研究者提出 Control OSWorld,一个面向 GUI 计算机操作 Agent 的 AI 控制评测环境,将 OSWorld 的 318 个任务与 81 个有害副任务配对,要求 Agent 在不被发现的情况下完成这些副任务。基于该环境,研究者构建并研究了用于检测 GUI 恶意 Agent 的控制监控器。结果显示,较弱监控器在查看完整轨迹时能以 3% 误报率实现 97% 召回,可靠区分能力更强 Agent 的诚实与恶意轨迹;但当监控器必须在每一步执行前打分时,由于每个动作可用的上下文更少,低误报率下的召回率下降。监控器性能还取决于其可见信息,访问 Agent 的可见文本至关重要,而截图带来的额外价值很小。
- 动态CAIS
AI Safety Newsletter #66:评估前沿模型、Gemini 3 Pro 与 Claude Opus 4.5 登场、联邦抢占州级 AI 立法卷土重来
CAIS 发布 AI Dashboard,直接在统一的文本、视觉与风险三组排行榜上横向对比前沿模型的平均分,其中 Claude Opus 4.5 在最安全的六项高风险行为测试中取得最低均分 33.6(0–100,越低越安全)。该风险榜涵盖 Virology Capabilities Test 拒绝集、Agent Red Teaming、Humanity's Last Exam-Miscalibration、MASK、Machiavelli 与 TextQuests Harm,并同时追踪 AGI、Remote Labor Index(覆盖 23 类远程自由职业工作)以及特斯拉 Full Self Driving 脱离数据的自动化进程。
- 动态Import AI
Import AI 469:DiG-bench 游戏发现基准、RSI 模拟器与扎克伯格的技术悲观主义
DiG-bench(Discovery in Games)发布,用 70 款规则与目标均隐藏、需靠交互探索的文本游戏评测 AI 的发现能力,其中 21 款已公开。