跳到正文
10月8日 · 周四

Anthropic · 论文

精选论文 29 篇
  1. 评测/基准arXiv:2605.16626 · 58

    Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现

    作者构建了含40个攻击的SLEIGHT-BENCH基准,Opus 4.6监控器在1% FPR下有50%攻击从未被捕获。

    • 32%Opus 4.6带扩展思考在ControlArena提示词、1% FPR下的单次试验捕获率(Figure 2)
    • 20 of 40Opus 4.6带扩展思考在ControlArena提示词、1% FPR、10次试验中从未捕获的攻击数(Section 5.1)
    • 52%Opus 4.6使用Claude Code智能体脚手架在ControlArena提示词下的捕获率(Figure 2)
    6 问速览评估代码智能体监控器在面对利用概念盲点的多样化规避攻击时的检测能力与防御失效情况。
    1. 这篇论文试图解决什么问题?

      评估代码智能体监控器在面对利用概念盲点的多样化规避攻击时的检测能力与防御失效情况。

    2. 有哪些相关研究?

      涉及AI控制协议、智能体监控基准与LLM能力缺陷研究,本文侧重于前沿监控器针对性盲点的系统化构建。

    3. 论文如何解决这个问题?

      梳理11类监控盲点,人机协同生成轨迹并剥离推理,经5个沙箱智能体验证器检验真实性与危害。

    4. 论文做了哪些实验?

      在1% FPR下前沿监控器单次捕获率为2%–54%,50%攻击能持续规避Opus 4.6,增加算力与针对性提示词可局部改善。

    5. 有什么可以进一步探索的点?

      局限包括合成轨迹缺少真实交互、良性分布可能失真,后续需探索动态红队;实验覆盖6个模型与40个攻击案例。

    6. 总结一下论文的主要内容

      评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。

    完整解读
  2. 评测/基准arXiv:2606.23130 · 60

    研究审计 200 个 vibe coding 应用,发现 1,186 个漏洞

    研究者审计了 200 个部署的 vibe-coding 应用,发现 91.00% 存在漏洞且 65.77% 达 Critical 或 High 级别。

    • 91.00%在 VIBEVULNS 审计的 200 个部署应用中,包含至少一个漏洞的应用占比(Figure 2)
    • 65.77%在 VIBEVULNS 检出的 1,186 个漏洞中,评级为 Critical 或 High 的占比(Table 2)
    • 28.58%在 VIBEVULNS 中,Broken Access Control 类别的漏洞数量占比(Table 2)
    6 问速览探究 vibe coding 全流程委托开发范式下,真实部署应用的安全漏洞现状、根因与缓解条件。
    1. 这篇论文试图解决什么问题?

      探究 vibe coding 全流程委托开发范式下,真实部署应用的安全漏洞现状、根因与缓解条件。

    2. 有哪些相关研究?

      系统梳理了 AI 辅助编程、仓库级安全评测与真实代码安全实证,指出本文聚焦全流程真实部署。

    3. 论文如何解决这个问题?

      构建 VIBEAPPS 与 VIBEVULNS 数据集,结合 2×2 多智能体审计、人工验证与受控重放实验。

    4. 论文做了哪些实验?

      91.00% 的部署应用含漏洞;重放中 production 提示词与加固 harness 最有效,professional 提示词反致恶化。

    5. 有什么可以进一步探索的点?

      作者指出开源样本、指纹与审计模型重叠等局限;实验未覆盖非 Web 类别、闭源应用与幻觉重放。

    6. 总结一下论文的主要内容

      论文全面揭示了部署 vibe-coded 应用的高危现状与成因,指出全流程管线防御优于单纯模型缩放。

    完整解读
  3. 评测/基准arXiv:2610.07639 · 58

    HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制

    在GLM-5.2与6款harness上,开启auto-approve使总体ASR从29.2%升至95.6%。

    • 95.6%GLM-5.2在AA评测中开启auto-approve时的总体ASR(Table 6)
    • 29.2%GLM-5.2在AA评测中关闭auto-approve时的总体ASR(Table 6)
    • 0.8%GLM-5.2在NI评测中开启网络隔离时的总体ASR(Table 6)
    6 问速览代码智能体harness的安全机制实现现状与运行时防护效果缺乏系统评估,论文提出了十机制分类法与基准测试HSB。
    1. 这篇论文试图解决什么问题?

      代码智能体harness的安全机制实现现状与运行时防护效果缺乏系统评估,论文提出了十机制分类法与基准测试HSB。

    2. 有哪些相关研究?

      既有研究涵盖harness分类、生命周期安全审计与特定载荷注入基准,但缺乏对原生机制ON/OFF状态的双重判定隔离评估。

    3. 论文如何解决这个问题?

      建立十机制分类与五方独立审计矩阵,并通过Docker环境注入五类攻击面,以双重预言机量化ON/OFF状态差异。

    4. 论文做了哪些实验?

      在GLM-5.2下开展2500次试验,发现机制防护效果与效用代价分化明显,部分机制存在解释器绕过路径。

    5. 有什么可以进一步探索的点?

      作者指出基准受限于单模型评测、仿真环境保真度及闭源工具缺失,实验覆盖6款开源harness与23个任务。

    6. 总结一下论文的主要内容

      系统审计40款harness并实证评测9类安全机制,量化了自动审批的暴露风险、强隔离的效用代价以及替代执行路径绕过。

    完整解读
  4. 评测/基准arXiv:2604.02947 · 54

    AgentHazard:评估计算机使用智能体有害行为的基准

    作者针对计算机使用智能体提出 AgentHazard 基准,GLM-4.6 在 Claude Code 下 ASR 达 82.90%。

    • 82.90%Claude Code下GLM-4.6全轨迹ASR(Table 2)
    • 73.63%Claude Code下Qwen3-Coder全轨迹ASR(Table 2)
    • 74.70%IFlow下Qwen2.5-Coder-32B全轨迹ASR(Table 2)
    6 问速览现有基准难以评估计算机使用智能体在多步执行与工具调用中由局部合理操作累积涌现出的有害行为。
    1. 这篇论文试图解决什么问题?

      现有基准难以评估计算机使用智能体在多步执行与工具调用中由局部合理操作累积涌现出的有害行为。

    2. 有哪些相关研究?

      相关工作涵盖大语言模型文本与代码安全评测,以及智能体能力和安全基准,但未针对多步局部合理动作组合。

    3. 论文如何解决这个问题?

      构建由 10 类风险与 10 种策略组成的分类体系,通过任务模板生成、沙箱执行过滤、模型评判与人工审核产出基准。

    4. 论文做了哪些实验?

      评测显示当前智能体存在脆弱性,GLM-4.6 在 Claude Code 下 ASR 达 82.90%,防护模型全轮拼接最高检出 27.03%。

    5. 有什么可以进一步探索的点?

      作者指出当前防护模型缺乏轨迹感知且需探索运行时防御,其实验覆盖了 3 个框架与 8 款开源或可部署模型。

    6. 总结一下论文的主要内容

      AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    完整解读
  5. 评测/基准arXiv:2610.03153 · 53

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    论文评测工作空间智能体运行时风险,DeepSeek-V4-Pro-0813在Codex下ASR达68.44%。

    • 37.46%9种配置共4050次攻击执行的整体ASR(Finding 1)
    • 68.44%DeepSeek-V4-Pro-0813搭配Codex在450个用例上的ASR
    • 4.44%Claude Opus 5跨3种Harness聚合的ASR(Finding 2)
    6 问速览论文试图解决工作空间智能体运行时安全风险覆盖不全,以及缺乏可验证、可持续演化的执行基准的问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决工作空间智能体运行时安全风险覆盖不全,以及缺乏可验证、可持续演化的执行基准的问题。

    2. 有哪些相关研究?

      论文梳理了工作空间智能体、智能体安全基准与演化评测三类相关工作,定位自身为覆盖全流程入口与直接后果的基准。

    3. 论文如何解决这个问题?

      论文提出 EP–Path–EF 框架与生成-重放-提炼工作流,结合容器隔离与 ETW 事件实现自动化用例构建与独立结果验证。

    4. 论文做了哪些实验?

      论文评测 3 款模型与 3 款 Harness 构成的 9 种配置,整体 ASR 为 37.46%,模型间差异大于 Harness 间差异。

    5. 有什么可以进一步探索的点?

      作者指出基准仅针对 IPI 且沙箱简化了生产环境,实验覆盖了 3 款模型与 3 款 Harness 的 450 个用例。

    6. 总结一下论文的主要内容

      论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。

    完整解读
  6. 评测/基准arXiv:2608.19741 · 53

    微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性

    作者在507个业务任务上评测智能体,Claude Opus 5从66.50% pass@1降至47.53% passˆ20。

    • 66.50%Claude Opus 5在THINKINGBOX-BENCH上的pass@1
    • 47.53%Claude Opus 5在THINKINGBOX-BENCH上的passˆ20
    • 93.89%Kimi-K3在THINKINGBOX-BENCH上的pass@20
    6 问速览现有工具评测难以衡量智能体在多轮状态化业务中的完成度与状态变更副作用。
    1. 这篇论文试图解决什么问题?

      现有工具评测难以衡量智能体在多轮状态化业务中的完成度与状态变更副作用。

    2. 有哪些相关研究?

      相关研究涵盖交互沙箱、工具调用基准与专业工作流评测,本文聚焦状态化业务。

    3. 论文如何解决这个问题?

      构建基于MCP协议的THINKINGBOX沙箱,通过状态比对与副作用提取进行合取判题。

    4. 论文做了哪些实验?

      在507个任务上评测18个模型,Claude Opus 5在pass@1领先但多次试验稳定率下降。

    5. 有什么可以进一步探索的点?

      作者指出判题未覆盖回复文本保真度且依赖单一模拟器,实验覆盖5个领域507个任务。

    6. 总结一下论文的主要内容

      论文构建多轮业务沙箱与基准,分析多次重复执行差距并展示强化学习训练效果。

    完整解读
  7. 评测/基准arXiv:2607.18538 · 57

    CryptanalysisBench:五个前沿模型在 191 项密码分析任务上的表现

    评估五款前沿模型在191个密码分析任务中的表现:Tier 1破解率为65.3%–85.7%,并发现SpoC等设计缺陷。

    • 85.7%Claude Mythos 5在Tier 1(42/49)基准下的破解成功率(Table 2)
    • 65.3%GLM-5.2在Tier 1(32/49)基准下的破解成功率(Table 2)
    • 35.7%Claude Mythos 5在Tier 2 Easy难度下的破解成功率(Table 2)
    6 问速览评估前沿模型能否自主分析并攻破真实密码原语,弥补自动化密码分析基准的空白。
    1. 这篇论文试图解决什么问题?

      评估前沿模型能否自主分析并攻破真实密码原语,弥补自动化密码分析基准的空白。

    2. 有哪些相关研究?

      涵盖神经差分分析、LLM玩具解密及网络安全CTF,本文聚焦真实候选标准原语。

    3. 论文如何解决这个问题?

      构建三层级191个任务基准,依托Docker双容器博弈交互与脚本自动化重测验证。

    4. 论文做了哪些实验?

      五款模型在Tier 1达65%–86%成功率,发现SpoC等新缺陷,受制于求解器工程实现。

    5. 有什么可以进一步探索的点?

      作者指明资源限制、证明系统扩展与记忆干扰等局限,实际评测限定于特定资源与模型。

    6. 总结一下论文的主要内容

      提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。

    完整解读
  8. 评测/基准arXiv:2608.03070 · 57

    FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0

    FAR.AI评估前沿模型CBRNE及网安防御,Grok 4.5与Gemini 3.1 Pro现通用越狱,另两模型未破。

    • 63Grok 4.5 随机搜索下通用越狱数(Figure 1)
    • 18Gemini 3.1 Pro 随机搜索通用越狱数(Figure 1)
    • 385Grok 4.5 专家引导下通用越狱数(Figure 1)
    6 问速览前沿AI模型在高危领域的防御水平参差不齐,论文旨在建立基线测试标准并量化通用越狱风险。
    1. 这篇论文试图解决什么问题?

      前沿AI模型在高危领域的防御水平参差不齐,论文旨在建立基线测试标准并量化通用越狱风险。

    2. 有哪些相关研究?

      论文梳理了越狱攻击技术、防御分类器机制以及高危能力评测三类相关工作,定位本文为最低静态防御基准。

    3. 论文如何解决这个问题?

      论文提出了包含67个原语的越狱分类法,构建了双重危害数据集,并通过三阶段漏斗评测识别通用越狱。

    4. 论文做了哪些实验?

      评测覆盖4家厂商旗舰模型,Grok 4.5与Gemini 3.1 Pro暴露大量通用越狱,Claude与GPT均未失陷。

    5. 有什么可以进一步探索的点?

      作者指出了数据集双重用途歧义、评审漏报及静态局限,实验未覆盖动态自适应攻击和真实能力提升。

    6. 总结一下论文的主要内容

      论文系统评测了前沿模型对已知静态越狱的防御能力,揭示了厂商间防护鲁棒性的巨大分化。

    完整解读
已经到底了