跳到正文

危险能力 · 精选

10月9日 · 周五

危险能力 · 精选

今天还没有新的精选
10月8日周四
  1. AWS SecurityAWS Security · 2 篇报道 · 46

    AWS 发布 AI 漏洞分诊 steering 文件配置指南

    AWS 安全团队发布 AI 漏洞分诊 harness 的配置指南,用 steering file 把团队分诊方法论固化为模型每次会话加载的持久指令。指南给出五个关键配置段:先做结构验证,要求确认文件、函数、数据流和调用路径存在后再报告发现;用二元信号加权公式替代模型自报置信度,其中污点确认权重 0.30;解析 IaC 并按控制类型施加乘数,攻击阻断控制可叠加且下限为 0.15;接入 CISA KEV、EPSS 和公开 PoC 信号。同一时间,AWS 还介绍了一套三层流水线,把漏洞扫描器产生的大量候选发现收敛为少量带证据的高优先级问题:第一层用多扫描器一致性判断可信度,第二层借助代码抽象语法树验证扫描器描述的函数、文件与数据流是否真实存在,第三层结合 CloudFormation、Terraform 等 IaC 模板评估 WAF、网络隔离、认证等控制措施能否被绕过。作者强调该架构与具体工具无关,可替换自有扫描器和模型。

10月2日周五
  1. FAR.AI · 50

    FAR.AI 开源安全差距评估工具包,量化 Llama-3 移除护栏后的危险能力

    FAR.AI 发布开源工具包,用于移除开源指令微调模型的安全机制并评估由此产生的安全差距。工具包实现两种攻击方法,监督微调通过目标补全覆盖拒答行为,拒答消融则抑制模型内部与拒答相关的激活;评估覆盖多选题准确率、StrongReject 拒答行为和生成质量三个维度,训练流程已测试至 70B 参数,评估流程支持 405B。在 Llama-3.x-Instruct 系列(1B 至 405B)上的案例研究显示,WMDP-Bio 准确率随规模上升,移除护栏后对危险生物学请求的合规率大幅提高,准确率与合规率的乘积即有效危险能力随模型规模显著增长,说明安全差距在规模扩大时进一步拉大。作者指出当前仅支持微调和拒答消融两种攻击方法,数据集规模较小且框架针对对话模型优化。代码见 github.com/AlignmentResearch/safety-gap,论文见 arXiv:2507.11544。

10月1日周四
  1. METR · 47

    METR 复盘 AI 生物 RCT:五个关于证据型 AI 政策的经验

    METR 作者复盘其参与组织的 AI 生物随机对照试验(RCT),总结出五条面向证据型 AI 政策的经验。研究招募 153 名新手,随机分为 LLM 组和纯互联网组,在 8 周内完成分子生物学湿实验任务,如从基因序列重建病毒;结果显示 AI 在单个步骤上有帮助迹象,但在三项核心任务的端到端成功率上没有显著效果,这一结果出乎多数专家预料。

已经到底了