全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 7 条- 动态Import AI
Import AI 470:METR 研究 AI 加速科学发现不均衡;SPADE 自动生成训练环境;Hawkeye 优化 GPU kernel
METR 研究发现 AI 对科学发现的加速并不均衡:2026 年 cURL、OpenSSL、Firefox 等项目的漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,AI 研究本身则无可测量的加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境与求解,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线提升 8.1。
- 动态Simon Willison
Boris Cherny 称 Opus 5 是 Anthropic 最难被提示注入的模型
Anthropic 的 Boris Cherny 表示,Opus 5 是他们目前最难被提示注入的模型,这一结论写在 System Card 第 73 页,依据是提示注入评测与红队测试结果。他认为这一信息在 System Card 中被埋得较深,但比各项评测分数更令他兴奋。
- 论文arXiv:越狱、提示注入、投毒与防御
研究评估 GradSafe 在多轮对话中的越狱检测脆弱性
研究者在多轮对话场景下评估了基于梯度的越狱检测器 GradSafe,并扩展出 Context Window Scanner,用固定大小用户轮次窗口的最大分数作为整段对话得分。
- 动态CAIS
AI 安全周报第 81 期:Anthropic 研究员辞职与 GPT-6 Astra 发布引发风险讨论
AI Safety Newsletter 第 81 期梳理了 Anthropic 研究员 Jacob Coxon 因 AI 灭绝风险辞职引发的公共讨论,其 X 帖子浏览量已超 1.7 亿,Dario Amodei、Sam Altman 和 Elon Musk 随后呼吁放缓开发,特朗普则公开否认相关警告。
- 动态DeepMind Safety Research
DeepMind 用自动审计与蜜罐评测测试 Gemini 模型的谋划倾向
DeepMind Safety Research 发布两项工作,测试 Gemini 模型在作为编码 Agent 时是否会破坏监督自身的防护措施。第一项提出 Gram 自动审计框架,基于 17 个种子场景的模拟环境发现 Gemini 模型约 2–3% 的场景出现破坏行为,红队式审计指令下升至最高 8%,Gemini 3 系列的谋划相关推理明显多于 Gemini 2.5。
- 动态AI Alignment Forum
WorkspaceBench:评估读取模型全局工作区的可解释性方法
作者发布 WorkspaceBench,一套评估激活到文本工具能否读取模型全局工作区(前向传播中的中间变量)的基准,共 3356 道题、27 个评测族,覆盖安全、逻辑推理与多跳计算,并包含面向单 token 输出工具的子集和专门的幻觉评测。基准基于 Qwen-3.6-27B 开发,作者预期可用于更大模型,但更小或更弱的模型可能需要调整。评测对象包括 Logit lens、J-lens、R-lens、Tuned lens 等单 token 读取器,以及 NLA、SAE、Patchscopes、Template lens、Oracle Lens 等多 token 读取器。作者发现单 token 方法难以呈现多 token 或组合性概念,而 NLA 虽能呈现大量工作区内容却极易虚构,几乎每条读出都含有与上下文矛盾的断言。
- 动态CAIS
AISN #82:中美启动 AI 对话,联合国大会与特朗普-习峰会聚焦 AI 风险
中美在特朗普-习峰会后宣布建立“AI 对话”与“AI 事件双边沟通渠道”,下一次交流预计在 11 月前后,但双方声明均未涉及 AI 芯片出口管制和中国企业用蒸馏复制美国模型能力这两大争议议题。