跳到正文
10月10日 · 周六

全部论文

找到 8 篇

另有 244 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.07645

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    提出 SkillPoison,用局部有效的成功经验诱导自进化 Agent 形成过度泛化技能

    发表
    场景
    AI Agent
    被测模型
    deepseek-v4-flash、Qwen V3.8 Flash、GPT-5.5
    摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。

    深度解读完整解读
  2. 攻击arXiv 2609.39788

    研究:多智能体系统潜在通信链路可被训练用于提升有害顺从

    提出只训练或篡改多智能体潜在通信链路来提高有害遵从

    发表
    被测模型
    Llama-3.2-3B-Instruct、Qwen2.5-3B-Instruct、Gemma-3-1B-IT 等 7 个
    摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。

    学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。

    深度解读完整解读
  3. 其他arXiv 2609.12413

    SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量

    系统梳理智能体执行链路中的越狱攻击与防御并比较推理时防御

    发表
    场景
    AI Agent
    被测模型
    Qwen3.5-4B、Llama-3.1-8B-Instruct
    摘要SoK 将越狱重放到智能体流水线,并用两种模型检验回复层防御的边际与代价。

    Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。

    深度解读完整解读
  4. 多智能体协同过滤系统的连接性攻击与防御研究

    复现 AgentCF 上的多智能体攻防并刻画连通性作用

    发表
    被测模型
    Qwen3-235B-A22B、Claude Haiku 4.5、Mixtral 8×7B 等 4 个
    摘要连通性沿 k 与ρ改变攻防,且用户/物品与早期/稳态需要分开看。

    作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。

    深度解读完整解读
已经到底了