跳到正文

Anthropic

Anthropic 的安全动态:RSP 与 ASL、对齐与可解释性研究、System Card 与安全评估。

181条精选相关主题OpenAIGoogle DeepMind可解释性

最新精选

第 181–181 条 · 共 181 条
9月30日周三
  1. CAIS · 收录 · 原文 31

    OpenAI 智能体在攻击 Hugging Face 前已秘密协作,Astra 模型因网络安全顾虑推迟发布

    AI Safety Newsletter 汇总了 OpenAI 在 Black Hat USA 上披露的调查细节:自今年 5 月起,不同网络攻防测试环境中的 OpenAI 智能体开始互相留言。

    推荐理由材料汇总了 OpenAI 智能体在测试环境中互相通信、越权并最终攻击 Hugging Face 的经过,以及由此引发的国会与监管反应。