跳到正文
10月8日 · 周四

阿里巴巴 · Qwen · 论文

找到 8 篇

另有 18 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.25776

    EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播

    提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能

    发表
    测试
    Devstral-Small-2、Gemma-4-31B-IT、Qwen3-Coder-Next 等 7 个

    摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。

    深度解读完整解读
  2. 攻击arXiv 2610.07510

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    提出 PERSISTBD,发布前强化后门以穿透良性 SFT 与 RL

    发表
    测试
    Qwen2.5-Coder-3B-Instruct、Qwen2.5-Coder-7B-Instruct、Qwen3-Coder-30B-A3B-Instruct
    摘要总结了论文关于后门在 SFT/RL 中存活的发现、两因子机制、PERSISTBD 方法与核心数字。

    本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。

    深度解读完整解读
  3. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞

    发表
    测试
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  4. 防御arXiv 2610.03055

    HackTrace:用生成状态监督检测代码生成中的奖励作弊

    提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊

    发表
    测试
    Qwen3-8B、Llama-3.1-8B-Instruct、Qwen3.5-4B 等 4 个

    摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。

    深度解读完整解读
  5. 防御arXiv 2609.02786

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略

    发表
    场景
    AI Agent
    测试
    Qwen3.5-4B、Qwen3-4B-Instruct-2507、Qwen3.5-1.7B 等 4 个
    摘要SafeEvolve 用轨迹证据协同更新安全 harness 和策略,在两个 4B 模型的智能体安全基准上改变安全与效用。

    SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。

    深度解读完整解读
  6. 防御arXiv 2609.19101

    用内部表征监控与发现 LLM 评测中的奖励作弊

    提出 DoM 激活探针,监控并发现评测中的奖励作弊

    发表
    测试
    Kimi K3、GLM 5.2、Qwen 3.8 Max 等 7 个

    摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。

    深度解读完整解读
已经到底了