跳到正文
10月10日 · 周六

越狱与攻击 · 论文

找到 4 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 攻击arXiv 2610.05943

    CRIME 框架利用良性 Agent 技能组合诱发恶意行为

    提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为

    发表
    场景
    AI Agent
    被测模型
    DeepSeek-V4-Flash、GPT-4o-mini、GPT-4o 等 6 个
    摘要良性技能经 DCA 或 ACA 组合后可产生恶意环境后果,单独审查对不上。

    CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。

    深度解读完整解读
  2. 攻击arXiv 2608.27439

    RedEvoAgent:以经验驱动技能演化的自动红队智能体

    提出 RedEvoAgent,演化攻击技能对黑盒智能体做自动红队

    发表
    攻击者
    黑盒
    被测模型
    MiniMax-M2.5、DeepSeek-V4-Flash、Qwen3.5-35B
    摘要RedEvoAgent 用验证棘轮演化可读攻击技能,在两种产品级 harness 上多数设置高于固定工具与红队基线。

    RedEvoAgent 是面向产品级 black-box 智能体的自动红队方法,用一份可演化、人类可读的攻击技能编排多个越狱工具。。

    深度解读完整解读
已经到底了