跳到正文
10月8日 · 周四

阿里巴巴 · Qwen · 论文

找到 6 篇

另有 21 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.25776

    EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播

    提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能

    发表
    测试
    Devstral-Small-2、Gemma-4-31B-IT、Qwen3-Coder-Next 等 7 个

    摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。

    深度解读完整解读
  2. AgentHazard:评估计算机使用智能体有害行为的基准

    提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为

    发表
    测试
    Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct、Qwen3-32B 等 12 个
    摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。

    深度解读完整解读
  3. 防御arXiv 2610.03055

    HackTrace:用生成状态监督检测代码生成中的奖励作弊

    提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊

    发表
    测试
    Qwen3-8B、Llama-3.1-8B-Instruct、Qwen3.5-4B 等 4 个

    摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。

    深度解读完整解读
  4. 防御arXiv 2609.19101

    用内部表征监控与发现 LLM 评测中的奖励作弊

    提出 DoM 激活探针,监控并发现评测中的奖励作弊

    发表
    测试
    Kimi K3、GLM 5.2、Qwen 3.8 Max 等 7 个

    摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。

    深度解读完整解读
已经到底了