跳到正文
10月10日 · 周六

全部论文

找到 51 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.11932

    复旦团队测量 AI 搜索引用脆弱性:普通发帖可进入引用与答案文本

    测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答

    发表
    被测模型
    Grok、Doubao、ChatGPT 等 10 个

    摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。

    深度解读完整解读
  2. 防御arXiv 2610.11634

    LTBD:用可学习信任边界分隔符防御提示注入

    提出 LTBD,用可学习分隔符隔离可信指令与不可信数据

    发表
    被测模型
    Llama3-8B-Instruct、Llama3.1-8B-Instruct、Falcon3-7B-Instruct 等 4 个
    摘要LTBD 只训练四个分隔符嵌入。

    LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。

    深度解读完整解读
  3. 攻击arXiv 2610.09264

    研究者提出 PackHallu:经规则文件提示注入对编码 Agent 发起包幻觉攻击

    提出 PackHallu,经规则文件提示注入诱导编码 Agent 换用攻击者指定包

    发表
    被测模型
    Qwen2.5-Coder-7B、Qwen3-Coder-30B、Devstral-Small-2-24B 等 19 个
    摘要PackHallu 诱导规则文件换包。

    PackHallu 研究一种针对编程智能体规则文件的提示注入:让智能体在本应使用合法依赖时,改导入攻击者指定并控制的包。

    深度解读完整解读
  4. 攻击arXiv 2610.07645

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    提出 SkillPoison,用局部有效的成功经验诱导自进化 Agent 形成过度泛化技能

    发表
    场景
    AI Agent
    被测模型
    deepseek-v4-flash、Qwen V3.8 Flash、GPT-5.5
    摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。

    深度解读完整解读
  5. 攻击arXiv 2610.07510

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    提出 PERSISTBD,发布前强化供应链后门使其经良性 SFT 与 RL 后仍外发凭据

    发表
    被测模型
    Qwen2.5-Coder-3B-Instruct、Qwen2.5-Coder-7B-Instruct、Qwen3-Coder-30B-A3B-Instruct
    摘要总结了论文关于后门在 SFT/RL 中存活的发现、两因子机制、PERSISTBD 方法与核心数字。

    本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。

    深度解读完整解读
  6. 攻击arXiv 2610.05266

    论文披露主动式智能体的服务方间接提示注入攻击

    提出服务方间接提示注入,把主动智能体的决策协助转向预选目标

    发表
    场景
    AI Agent
    被测模型
    GPT-5、Claude Opus 4.6、Gemini 3 Pro 等 7 个
    摘要提供者侧间接注入用 T–B–S 把主动协助转向外部目标,并在三环境中提高模拟用户授权。

    外部提供者只控制与自身目标关联的内容,就可以把良性主动个人智能体的协助转向该目标。

    深度解读完整解读
  7. 攻击arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道

    发表
    场景
    AI Agent
    被测模型
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  8. 评测与基准arXiv 2609.39146

    MADBench:多智能体辩论安全性评测基准发布

    提出 MADBench,评测多智能体辩论是吸收还是放大对抗影响

    发表
    被测模型
    gpt-4o、GPT-5、GPT-6 Astra
    摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。

    MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。

    深度解读完整解读
  9. 防御arXiv 2610.00371

    FlowReview:以授权配对评测控制多智能体组合信息流

    提出 FlowReview,用授权配对与确定性提交门控控制多智能体组合信息流

    发表
    被测模型
    Sonnet 4.5、Haiku 4.5、Qwen3-32B 等 5 个
    摘要配对标准要求拒绝禁止使用并完成授权使用,FlowReview 把三项审查接到执行。

    这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。

    深度解读完整解读
  10. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性

    发表
    被测模型
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  11. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控

    发表
    场景
    AI Agent
    被测模型
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  12. 攻击arXiv 2609.19722

    ALIBI:向二进制注入虚假安全叙事可让 LLM 恶意软件分析器误判

    提出 ALIBI,向恶意二进制注入不执行掩护叙事使分析器误判为良性

    发表
    攻击者
    黑盒
    被测模型
    Gemini 2.5 Pro、GPT-5.5 Pro、Claude Opus 4.7
    摘要ALIBI 用二进制内的掩护叙事重释可疑静态证据,Gemini 上翻转多,另两模型主要为降级。

    ALIBI 是针对 LLM 恶意软件分诊的语义掩护叙事攻击:不覆盖系统指令,而把仍可见的可疑静态证据重释成良性安全产品的预期行为。

    深度解读完整解读
  13. 评测与基准arXiv 2609.17320

    Emergence World:对长时程多智能体系统开展对抗压力测试

    提出 Emergence World,对长时程多智能体系统开展对抗压力测试

    发表
    被测模型
    Claude Opus 4.8、DeepSeek v4 Pro、Gemini 3.5 Flash 等 9 个

    摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    深度解读完整解读
  14. 攻击arXiv 2609.13889

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私

    发表
    被测模型
    DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max

    摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。

    深度解读完整解读