跳到正文

#红队

今天还没有收录新动态

第 2 页更新的内容回到最新

8月1日周五
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    保障智能体 AI 安全:语义提示注入如何绕过 AI 护栏

    语义提示注入能够绕过 AI 护栏,成为智能体 AI 面临的新安全威胁。自大语言模型部署早期起,提示注入就通过操纵输入让模型产生非预期行为;防御方在文本攻击上已有进展,但多模态与智能体 AI 的转变正在快速扩大攻击面,红队测试在此发挥关键作用。

6月3日周二
2月26日周三
12月17日周二
10月16日周三
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 60

    Anthropic 可解释性团队:用字典学习特征训练分类器

    Anthropic 可解释性团队报告了用字典学习提取的特征替代原始激活训练生物武器有害/无害分类器的初步实验。在合成数据上,线性特征分类器与原始激活分类器表现相当甚至略优,用 max-pooling 聚合整个上下文窗口的特征激活是关键;在跨语言和 base64 等编码的分布外数据集 synthetic_3 上,特征分类器的 ROC_AUC 为 0.96,原始激活为 0.9。基于特征激活的决策树性能弱于线性分类器,但更易解读。特征可视化还能发现数据集中的伪相关,例如一个预测无害的特征会因学术出版格式文本而激活,作者据此构造的对抗后缀让 300 条有害提示中的绝大多数被误判为无害,而用原始激活系数构造的类似攻击效果差得多。

    推荐理由Anthropic 可解释性团队公开了用字典学习特征训练生物武器分类器的初步实验,并展示如何借特征可视化找出数据集中的伪相关。

已经到底了