跳到正文
10月9日 · 周五

全部论文

找到 113 篇

另有 426 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2605.19847

    论文揭示多租户 RAG 账号合谋使隐私泄露随账号数线性增长

    提出零知识审计协议,核验多租户 RAG 的合谋差分隐私

    发表
    摘要揭示多租户 RAG 合谋泄露按根号 k 放大,提出带零知识证明的无泄露审计协议。

    论文针对多租户 RAG 服务在多账户协同攻击下隐私边界失效的问题展开研究。

    深度解读完整解读
  2. 攻击arXiv 2608.05563

    研究者提出 PoisonedEvolution 轨迹投毒攻击

    提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统把恶意行为固化为技能

    发表
    场景
    AI Agent
    摘要论文揭示自演化技能系统的证据晋升漏洞,提出并验证轨迹投毒攻击。

    这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。

    深度解读完整解读
  3. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器

    发表
    攻击者
    黑盒、灰盒

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  4. 攻击arXiv 2608.04192

    研究者提出 SkillClone,仅凭正常提问即可克隆 LLM Agent 隐藏技能功能

    提出 SKILLCLONE,仅凭良性任务交互重构 Agent 隐藏技能功能

    发表
    场景
    AI Agent
    攻击者
    黑盒
    摘要论文揭示了仅靠良性任务交互即可重构闭源智能体技能隐藏功能的风险,表明功能保密需要限制累积信息泄露。

    论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。

    深度解读完整解读
  5. 攻击arXiv 2604.02623

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆

    发表
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    深度解读完整解读
  6. 攻击arXiv 2610.07645

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    提出 SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成

    发表
    场景
    AI Agent
    摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。

    深度解读完整解读
  7. 摘要总结了论文关于后门在 SFT/RL 中存活的发现、两因子机制、PERSISTBD 方法与核心数字。

    本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。

    深度解读完整解读
  8. 防御arXiv 2610.06001

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出 AgentSpy,在系统调用层观测 Agent 并检测技能注入

    发表
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    深度解读完整解读
  9. 防御arXiv 2610.05826

    研究者提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    发表
    摘要用截止期限制未核验可见时长。

    这篇工作给持续摄入的 RAG 向量库一个失败关闭的临时可见性协议,把协议能限制的未核验暴露和依赖检测器的中毒暴露分开。

    深度解读完整解读
  10. 攻击arXiv 2610.04128

    研究显示拆分学习中的梯度可提升客户端文本重建率

    衡量分裂学习中梯度相对激活对客户文本重建的额外贡献

    发表
    摘要激活已恢复大部分 token。

    这篇工作测量 split learning 分裂点上的文本泄漏:激活单独能恢复多少,训练回传的梯度再增加多少,以及按 token 还是按整篇计分会不会改写结论。

    深度解读完整解读