全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 6 条- 动态Gray Swan AI
Gray Swan 推出 Arena 平台,并新增针对 o1 的思维链挑战
Gray Swan 在首届 Jailbreaking Championship 结束后推出社区红队平台 Gray Swan Arena,用于在受控环境中持续测量模型护栏面对公开用户时的表现。首届比赛于 2024 年 9 月至 10 月举行,共有 631 名参与者、提交 10,000 条越狱、进行 100,000 次越狱尝试,覆盖 25 个模型,奖金总额 40,000 美元。参与者可继续参加原有的 Single Turn Harmful Outputs 挑战,该挑战新增了 OpenAI 的 o1 模型。平台同时上线新挑战 Revealing Hidden CoT,悬赏 1,000 美元用于揭示 o1 的内部思维链。o1 相关挑战的报名已在官网开放,发布时间为 2024 年 10 月 29 日下午 1:00 EST。
- 动态Gray Swan AI
Gray Swan AI 推出 Dangerous Reasoning Arena 竞赛,聚焦思维链越狱
Gray Swan AI 于 5 月 10 日启动 Dangerous Reasoning Arena 竞赛,将红队测试从输出操纵推进到模型内部推理层面,重点考察思维链越狱。参赛者需诱导模型产生生物攻击规划、战略性欺骗、隐蔽后门植入、基础设施破坏等危险推理,即使最终回复看似无害,只要内部逻辑体现有害意图即算成功。热身周 5 月 10 日开启(不计奖),正式评奖轮次为 5 月 17 日和 5 月 24 日,总奖池 20,000 美元。
- 论文arXiv
Meerkat:跨大量 Agent 轨迹检测安全违规
研究者提出 Meerkat,将聚类与智能体搜索结合,用自然语言描述违规行为并在大量 Agent 轨迹中定位稀疏失败。该方法不依赖种子场景、固定流程或穷举,通过结构化搜索和自适应调查有潜力的区域来发现违规。在滥用、失准和任务博弈等场景中,Meerkat 的违规检测效果显著优于基线监控器,并在一个头部 Agent 基准上发现大量开发者作弊行为,在 CyBench 上找到的奖励作弊案例比此前审计多近 4 倍。论文共 35 页、17 张图,作者为 Adam Stein、Davis Brown、Hamed Hassani、Mayur Naik、Eric Wong。
- 动态Adversa AI
2026 年 6 月 GenAI 安全资源盘点:越狱、CoT 攻击与百万级暴露服务
Adversa AI 汇总 2026 年 6 月 GenAI 安全资源共 19 项,其中研究 7 项、防御 6 项、攻击 5 项、利用 1 项。研究指出对齐模型内部存在可识别的拒答逃逸方向,攻击者可将模型自身思维链变为越狱通道,降低图像分辨率即可绕过多模态安全。对约 100 万个暴露 AI 服务的扫描发现 1,652 个未认证 Ollama API 在对外提供模型,可被用于响应投毒。
- 动态Transformer Circuits
Anthropic 可解释性团队发布 2024 年 7 月 Circuits Updates
Anthropic 可解释性团队发布 2024 年 7 月 Circuits Updates,梳理机制可解释性当前面临的五个主要障碍:缺失特征、跨层叠加、注意力叠加、干扰权重与宏观理解。团队认为叠加问题已有显著进展,但可能只能提取到一小部分特征,大量稀有特征或成为神经网络中的暗物质。文章还重新界定线性表示,区分特征是否一维与特征是否在数学上线性,并讨论多维特征的几何约束。在注意力透视表方面,团队复现了单层 Transformer 的 skip-trigram 结果,报告约 25–75% 可解释条目,并建议对低于约 10% 的表格保持怀疑。
- 动态Failure-First
WCM:面向通用人机交互的世界认知模型
陈等人提出世界认知模型(WCM),用 SLAK 架构将感知、逻辑、动作、知识四模块解耦,并采用异步运行时让推理、人机交流与物理执行并行。在 9 项真实物理交互任务上平均成功率为 73.8%,剩余 26.2% 未处理任务余量被作者视为红队测试的诊断入口。异步设计也带来延迟与状态失同步风险,机器人可能基于已失效的世界状态行动。