跳到正文
10月9日 · 周五

危险能力 · 论文

找到 4 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 24 篇还没打标签,不在筛选结果里。

另有 24 篇论文还没打上分类标签,暂不在筛选结果里。

  1. BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准

    提出 BioSecBench-Refusal,评测智能体生物安全拒答是否对准风险

    发表
    测试
    Gemini 3.5 Flash、Gemini 3.1 Pro、Opus 4.8 等 10 个
    摘要配对基准显示拒绝多由 API 触发,合法任务常被拒得不少于隐蔽危害。

    BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。

    深度解读完整解读
  2. 防御arXiv 2610.00850

    AuraForge:为训练安全编码 Agent 扩展安全监督

    提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体

    发表
    测试
    Gemini 3.1 Pro、Qwen3.5-4B、Muse Spark 1.3 等 11 个
    摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。

    AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。

    深度解读完整解读
  3. 攻击arXiv 2609.15383

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    发表
    攻击者
    黑盒
    测试
    Gemma-4-31B、Gemma-4-12B、GPT-5.5 等 7 个

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    深度解读完整解读
已经到底了