跳到正文

开源模型安全 · 精选

10月9日 · 周五

开源模型安全 · 精选

今天还没有新的精选
10月8日周四
  1. AWS Security、Strands AgentsAWS Security 等 2 个来源 · 2 篇报道 · ↑152

    AWS 发布 Strands Box 智能体沙箱

    AWS 以开发者预览形式发布开源沙箱 Strands Box,采用 Apache 2.0 许可,把操作系统级隔离与细粒度策略结合,用于约束 AI Agent 行为。Box 内嵌此前开源的策略语言 Dogwood 及其本地评估引擎,在网络出口、Python 解释器、Shell 解释器和 MCP 服务器代理等多个执行点做允许或拒绝判定,各执行点共享事件历史,规则因此可依赖 Agent 此前的动作,例如限制 Agent 每 10 分钟的调用次数。Strands Box 采用内核级隔离,但把策略层放在用户空间,使所有系统与工具交互只能经由策略层,从而对 MCP 调用、shell 与 Python 程序、文件系统和网络访问实施策略;策略可按工具粒度确定性执行,例如要求 git push 前必须通过 npm test,或限制某智能体每天调用支付 API 的次数。

10月7日周三
  1. arXiv:越狱、提示注入、投毒与防御、LADE authorsarXiv:越狱、提示注入、投毒与防御 等 2 个来源 · 2 篇报道 · 55

    LADE:利用暗知识潜安全信号防御越狱

    LADE(Latent Safety Signals for Defense)是一种解码阶段的 LLM 越狱防御方法:通过对比有害与良性查询,从参考模型首个 token 输出概率分布的暗知识中提取概率差异最大的 top-k=500 个 token,经 Tokenizer Mapping 适配不同分词器的目标模型,再用 kNN 距离在生成前判断并拦截查询。该方法不需要梯度、隐藏状态或第二个模型,信号只需从参考模型提取一次即可复用到其他模型。在 6 个开源 LLM、5 种越狱攻击及多种基准上,LADE 对多种越狱攻击保持稳健,降低攻击成功率并维持安全与效用的平衡。

10月3日周六
  1. Anthropic Alignment Science · 51

    AE Studio 与 Anthropic 提出 GRAM:用模块化预训练隔离危险知识的初步研究

    AE Studio 与 Anthropic 合作提出 Gradient Routed Auxiliary Modules(GRAM),通过在 Transformer 每个 MLP 层加入辅助模块并按数据类型选择性更新,把危险知识隔离到可开关的模块中,从而在单次训练里近似多个按数据过滤分别训练的模型。在 2M 条儿童故事合成语料上,26M 参数模型可开关特定故事主题知识,关闭后表现接近从未训练该主题的模型;在 800M 参数模型上,训练数据包含网络文本、代码、科学论文以及病毒学、网络安全、核物理和专门代码四个两用领域(每个约占 0.25%),单个 GRAM 模型可重配置为匹配五种不同过滤模型的表现,且对恶意微调的对抗性诱导保持稳健,而事后知识移除方法 MaxEnt 会恢复到接近全数据基线。作者给出初步证据,GRAM 在能力组合和标签稀疏(仅 50% 数据有标签)场景下优于 LoRA,但说明这只是两个孤立实验,不确定能否推广;研究属初步,尚未用于 Anthropic 的生产模型。

10月2日周五
  1. Mistral AI · 43

    Mistral 发布 Shieldstral:3B 开源多模态安全分类器

    Mistral 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,把内容审核建模为策略自适应的问答任务,在推理时接受自然语言政策而无需重新训练。模型每次请求由 <Instruct> 评估上下文与严格度、<Query> 单个是非问题、<Document> 待判定内容三部分组成,只读取 yes 和 no 两个 token 的 logits 并做 softmax 归一化,输出连续安全分数。Mistral 称其在文本安全、拒答检测、策略适应性和多模态基准上匹配或超过最多 7 倍于其规模的开放护栏模型,可在单张 16GB NVIDIA GPU 上运行,以 Apache 2.0 许可开放权重。训练上统一异构数据集的标签体系,用对比式改写让模型区分相近政策,并用视觉语言重排器过滤图像数据,最后通过 LoRA 微调与 SLERP 合并多个 checkpoint。

10月1日周四
  1. Unit 42 · 50

    Unit 42 提出扰动探测方法,定位 LLM 安全拒答的少量神经元

    Unit 42 提出扰动探测方法,每个提示词只需两次前向传播,即可定位对齐 LLM 中因果上负责特定行为(如拒绝有害请求)的少量前馈神经元。在开源模型 Qwen3-4B 上,350,208 个前馈神经元中仅 50 个(约 0.014%)控制安全拒答模板,移除后 520 条标准有害提示基准中 80% 的回复格式发生变化,并在第二个标准基准的 200 条提示上复现。在更小的 Qwen3.5-2B 上,仅 20 个神经元即可让多轮对话中的错误附和行为从 36.7% 降至 0%(30 个问题)。同一计算还给出 FFN/Skip 比值,可在数秒内算出,在测试的 13 个模型中解释了安全行为脆弱性 81% 的方差,可作为量化的安全脆弱性评分。

已经到底了