跳到正文
10月8日 · 周四

Google DeepMind · 论文

找到 3 篇
  1. 评测与基准arXiv:2610.07639 ·

    HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制

    提出HarnessSecurity-Bench,横向评测编码智能体框架的安全机制

    测试
    GLM-5.2、Qwen3.8-27B、Claude Opus 4.8 等 4 个应用层
    摘要系统审计40款harness并实证评测9类安全机制,量化了自动审批的暴露风险、强隔离的效用代价以及替代执行路径绕过。
    • 论文定位:该研究是针对开源与闭源代码智能体harness原生安全机制的系统性实证分析与基准评测。
    • 核心问题:针对代码智能体harness安全机制实现状态不透明、在对抗环境下防护能力及对合法开发效用影响缺乏定量评估的问题展开研究。
    • 方法体系:作者构建了包含10类安全机制的分类法,通过研究人员与LLM独立评审审计了40款harness的400个单元格;进一步提出包含23个任务的HARNESSSECURITY-BENCH,在隔离容器中利用确定性预言机评测6款harness在开启与关闭机制下的表现。
    • 关键实验发现:
      • 在GLM-5.2基线与6款harness测试中,开启auto-approve使总体任务效用从77.1%升至95.4%,但ASR从29.2%升至95.6%(Table 6)。
      • 网络隔离(NI)与只读模式(RO)大幅降低攻击效果,总体ASR分别降至0.8%和0.8%,但分别带来24.5和34.0个百分点的效用损失(Table 6、Table 7)。
      • 命令白名单(CAL)将ASR降至50.0%且效用仅微降1.5个百分点;命令黑名单(CDL)将ASR降至1.3%,同时因阻断破坏性操作使效用提升5.2个百分点(Table 6)。
    • 绕过路径与安全风险:案例分析显示,限制共享能力会同时误伤合法操作,且仅限制特定直接命令仍可通过受信任的解释器等替代路径绕过控制(Section 6.3)。
    • 作者建议与启示:作者建议harness提供商发布机制级说明并暴露运行时生效设置以增强可验证性,针对受保护资源测试所有替代访问路径,并在评估安全机制时综合权衡攻击效果、任务效用与资源执行开销。
    完整解读
  2. 评测与基准arXiv:2607.20891 ·

    MisKnow-Agent 评测:单篇误导文档使 Deep Research 错误结论平均采纳率升至 54.7%

    提出MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识

    测试
    Gemini Deep Research、DeepSeek-V4 Pro、Qwen3.5-397B 等 4 个应用层
    场景
    AI Agent
    摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
    • 定位与核心问题:本文评估大语言模型长程研究(Deep Research)智能体在开放信息环境下的内容可靠性,重点探究智能体是否会在最终报告中采纳具有表面可信度但事实错误的误导性知识作为自身结论。
    • 方法设计要点:提出 MisKnow-Agent 受控评估框架,针对 DeepResearch Bench 的 100 个任务构建人工审核的虚假结论蓝图,生成跨 3 个权威层级与 4 种风格的误导文档,并经 5 个搜索验证模型交叉检验与人工质量筛选保留 5,933 篇文档;同时设计了前置验证提示与后置精炼智能体两阶段防御。
    • 暴露与来源影响:实验表明无注入对照下平均虚假结论采纳率(FCAR)为 0%,注入 1 篇误导文档即升至 54.7%(Figure 5);搜索结果排名位置对采纳率影响较小(Front 与 Back 仅差 1.7 个百分点),而在最终合成前引入误导文档使平均采纳率升至 85.5%(Figure 3);学术论文风格产生的采纳率最高(61.0%),较社交帖子高出 23.5 个百分点(Figure 4)。
    • 系统与框架差异:在默认高权威学术论文风格下,DeerFlow 平均 FCAR(67.0%)高于 WebThinker(55.0%),差距随模型智力指数提升而缩小,但采纳率与智力指数不呈单调关系(Table 3);Gemini Deep Research 同样表现出类似趋势,FCAR 在 1 篇时为 27%,在 3 篇时达到 54%(Figure 7)。
    • 防御表现与启示:前置提示、后置精炼及组合防御可将 DeerFlow 上的 FCAR 从基线的 60%–76% 降至 15%–62%,但无法完全消除采纳,且在 Intern-S1-Pro 上组合防御(62%)高于单项防御(Figure 7);作者认为仅靠隔离识别误导文档并不充分,必须将验证与修正机制贯穿于证据获取、中间研究状态和最终合成的全流程。
    完整解读
  3. 评测与基准arXiv:2608.03070 ·

    FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0

    建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力

    测试
    Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 等 8 个提示层
    摘要论文系统评测了前沿模型对已知静态越狱的防御能力,揭示了厂商间防护鲁棒性的巨大分化。

    本研究针对前沿AI大模型在CBRNE与网络高危滥用领域的安全防护,提出了FAR.AI最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。

    完整解读
已经到底了