跳到正文
10月8日 · 周四

红队 · 论文

找到 19 篇

另有 95 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2607.11698 ·

    AHA 用自动研究循环发现生产 Agent 漏洞概念

    提出 AHA 自动科研循环,发现生产级智能体的可复用漏洞概念

    编程 Agent攻击者黑盒测试Minimax-M2.7、Kimi-K2.6、Deepseek-V4-Pro 等 5 个应用层
    摘要论文提出基于可证伪科研循环的 AHA 框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    完整解读
  2. 评测与基准arXiv:2609.09798 ·

    CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    编程 Agent攻击者黑盒无盒测试CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个应用层

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    完整解读
  3. 评测与基准arXiv:2608.03070 ·

    FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0

    建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力

    模型与 API测试Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 等 8 个提示层
    摘要论文系统评测了前沿模型对已知静态越狱的防御能力,揭示了厂商间防护鲁棒性的巨大分化。

    本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。

    完整解读
已经到底了