跳到正文
10月9日 · 周五

阿里巴巴 · Qwen · 论文

找到 4 篇

另有 15 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.02786

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略

    发表
    场景
    AI Agent
    测试
    Qwen3.5-4B、Qwen3-4B-Instruct-2507、Qwen3.5-1.7B 等 4 个
    摘要SafeEvolve 用轨迹证据协同更新安全 harness 和策略,在两个 4B 模型的智能体安全基准上改变安全与效用。

    SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。

    深度解读完整解读
  2. 可解释性arXiv 2609.06934

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练

    发表
    测试
    Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个

    摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    深度解读完整解读
  3. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,延迟激活 Agent 的间接提示注入

    发表
    场景
    AI Agent
    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
  4. 评测与基准arXiv 2609.24662

    DUMA-Bench:评估 LLM Agent 安全的双控多智能体基准

    提出双控多智能体基准 DUMA-Bench,评测 Agent 策略违反

    发表
    测试
    GPT-5、GPT-5-mini、GPT-5-nano 等 14 个
    摘要DUMA-Bench 用双控交互评测智能体安全。

    DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。

    深度解读完整解读
已经到底了