跳到正文
10月9日 · 周五

全部论文

找到 42 篇

另有 648 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.16246

    CompoSkill 框架利用逐个通过扫描的 Agent 技能组合发起攻击

    提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链

    发表
    场景
    AI Agent
    测试
    GPT-5.4、Gemini-3.1-flash、DeepSeek-V4 等 4 个

    摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。

    深度解读完整解读
  2. 攻击arXiv 2608.04192

    研究者提出 SkillClone,仅凭正常提问即可克隆 LLM Agent 隐藏技能功能

    提出 SKILLCLONE,仅凭良性任务交互重构 Agent 隐藏技能功能

    发表
    场景
    AI Agent
    攻击者
    黑盒
    测试
    DeepSeek-Flash、DeepSeek-Pro、GLM-5.1 等 6 个
    摘要论文揭示了仅靠良性任务交互即可重构闭源智能体技能隐藏功能的风险,表明功能保密需要限制累积信息泄露。

    论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。

    深度解读完整解读
  3. 攻击arXiv 2608.04741

    LoginTrap:针对 LLM Web Agent 的任务无关钓鱼式间接提示注入攻击

    提出 LoginTrap,用网页弹窗实施任务无关钓鱼式间接提示注入并窃取敏感信息

    发表
    测试
    GPT-4o、Gemini 3 Flash、Claude Sonnet 4 等 7 个

    摘要揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。

    深度解读完整解读
  4. 评测与基准arXiv 2610.10276

    PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤

    提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤

    发表
    测试
    Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it 等 8 个

    摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。

    深度解读完整解读
  5. 攻击arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性

    发表
    场景
    AI Agent
    测试
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  6. 攻击arXiv 2607.25560

    SigLeak 可从执行轨迹推断专有 Agent 技能

    提出 SigLeak,从良性查询的执行轨迹推断专有 Agent 技能

    发表
    场景
    AI Agent
    攻击者
    黑盒
    测试
    GPT-5.4-mini、GPT-5.5、GLM-5.2 等 4 个

    摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。

    深度解读完整解读
  7. 攻击arXiv 2608.09867

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链

    发表
    攻击者
    黑盒
    测试
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5 等 15 个

    摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    深度解读完整解读
  8. 分析与理论arXiv 2609.33898

    研究揭示训练效率与模型脆弱性的权衡:高效训练更易受对抗与隐私攻击

    比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何

    发表
    测试
    ResNet-18、Swin Transformer、Qwen2.5-Math-7B-Instruct 等 7 个
    摘要效用匹配下,三种高效训练都伴随更高的隐私与对抗脆弱性及更尖的损失几何。

    作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。

    深度解读完整解读
  9. 防御arXiv 2609.02786

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略

    发表
    场景
    AI Agent
    测试
    Qwen3.5-4B、Qwen3-4B-Instruct-2507、Qwen3.5-1.7B 等 4 个
    摘要SafeEvolve 用轨迹证据协同更新安全 harness 和策略,在两个 4B 模型的智能体安全基准上改变安全与效用。

    SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。

    深度解读完整解读
  10. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具智能体推理链以绕过思维链监控

    发表
    场景
    AI Agent
    测试
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  11. 攻击arXiv 2610.01768

    LLMLeak:借 LLM 合法网页抓取实施隐蔽数据外泄

    提出 LLMLeak,把机密编进报错 URL,借聊天机器人网页抓取外传

    发表
    场景
    AI Agent
    测试
    Meta-Llama-3.3-70B-Instruct、Meta-Llama-4-Scout-17B-16E-Instruct、Meta-Llama-3.1-8B-Instruct 等 15 个
    摘要LLMLeak 用报错 URL 借聊天机器人抓取外传秘密。

    LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。

    深度解读完整解读
  12. 防御arXiv 2609.40286

    研究者提出 COVER:在语言预算下选择源语言实现跨语言遗忘

    提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘

    发表
    测试
    Tiny Aya Global、Qwen3-4B-Instruct-2507、Llama-3.2-3B-Instruct
    摘要COVER 在语言预算下选源语言,以降低未监督语言上相对 oracle 的残余访问。

    语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。

    深度解读完整解读
  13. 防御arXiv 2609.31056

    SCALPEL:用对比稀疏自编码器实现选择性表征层遗忘

    提出 SCALPEL,用对比 SAE 在表征层选择性遗忘特定事实

    发表
    测试
    Qwen2.5-1.5B-Instruct、Llama-3.2-1B-Instruct、Gemma-2-2B-it
    摘要SCALPEL 以对比稀疏特征做窄目标表征遗忘,在 TOFU 上与优化基线相当且可检查。

    SCALPEL 是不改基座权重的表征层遗忘方法,面向与保留数据重叠的窄目标。

    深度解读完整解读
  14. ACEA:面向红蓝队对抗的 LLM 协同演化测试平台

    提出红蓝对抗评测平台 ACEA,分开计量攻击强度与防御效果

    发表
    测试
    openai/gpt-4o、google/gemini-2.5-pro、google/gemma-3-27b-it 等 5 个
    摘要ACEA 用 ASAP 让红蓝对同一目标对打。

    ACEA 是让可插拔红队和蓝队共享一个目标 LLM 的对打场地,把攻击强度和防御效果分开记分。作者要补三处空缺:双方只能对着固定对手分开练。LLM judge 分不清真实泄露和幻觉,拦截后又看不到攻击有多强。

    深度解读完整解读
  15. 评测与基准arXiv 2609.15017

    PIDS-Bench:在过度防御、混淆与分布偏移下评测提示注入检测器

    提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现

    发表
    测试
    TF-IDF + logistic regression、DistilBERT、DeBERTa-v3-FT 等 8 个
    摘要PIDS-Bench 显示高分布内 F1 仍会过度拦截外部来源的安全相关良性输入。

    PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。

    深度解读完整解读