跳到正文
10月9日 · 周五

全部论文

找到 40 篇
筛选4

另有 669 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2607.03968

    研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容

    提出工作流级越狱构建,经多轮开发工作流诱导编程 Agent 在代码中写出有害内容

    发表
    攻击者
    黑盒、无盒
    测试
    Gemini 3.1 Pro、Gemini 3.5 Flash、Claude Sonnet 4.6 等 5 个

    摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。

    深度解读完整解读
  2. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器

    发表
    攻击者
    黑盒、灰盒
    测试
    GLM-5.2、GPT-5.5、DeepSeek-V4-Pro

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  3. 攻击arXiv 2608.25776

    EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播

    提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能

    发表
    测试
    Gemma-4-31B-IT、Devstral-Small-2、Qwen3-Coder-Next 等 7 个

    摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。

    深度解读完整解读
  4. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    测试
    Gemma-4-12B、Qwen3-8B、Qwen3-VL-8B-Instruct 等 4 个

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  5. 攻击arXiv 2610.07723

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    发表
    测试
    Gemma-7B-it、Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3 等 4 个

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    深度解读完整解读
  6. 攻击arXiv 2610.06848

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员

    发表
    攻击者
    黑盒
    测试
    BERT (4.4M-340M)、ViT (22M-307M)、Pythia (70M-2.8B) 等 5 个

    摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。

    深度解读完整解读
  7. 攻击arXiv 2609.18217

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御

    提出跨通道分段攻击,利用 MCP 隐式信任诱导外发敏感文件

    发表
    测试
    Gemini 2.5 Flash、GLM-5、GPT-4o 等 15 个

    摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    深度解读完整解读
  8. 攻击arXiv 2607.23496

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景

    发表
    攻击者
    白盒、黑盒
    测试
    Gemini-3-Flash、Gemini-3.1-Pro、Qwen3.5-9B 等 10 个

    摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    深度解读完整解读
  9. 攻击arXiv 2607.12340

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持

    发表
    测试
    GLM-4.5-Air、GPT-5.4-mini、Claude Sonnet 4.6 等 10 个
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    深度解读完整解读
  10. 攻击arXiv 2608.09867

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链

    发表
    攻击者
    黑盒
    测试
    Gemini 3.1 Pro、Gemini 3.5 Flash、Gemini Robotics 1.6 等 15 个

    摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    深度解读完整解读
  11. 攻击arXiv 2610.00392

    A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型

    提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据

    发表
    测试
    glm-5.3、MiniMax-M3、deepseek-v4-pro 等 8 个
    摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。

    A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。

    深度解读完整解读
  12. 攻击arXiv 2610.01062

    Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

    提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱

    发表
    测试
    Gemma-2-9B-IT、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 等 6 个
    摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。

    Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。

    深度解读完整解读
  13. 攻击arXiv 2609.08186

    论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式

    揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱

    发表
    测试
    GLM4.6、Qwen3-8B、Qwen3-14B 等 8 个
    摘要更深推理提升题目准确率,同时提高扰动下的相对损失。

    作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。

    深度解读完整解读
  14. 攻击arXiv 2609.15383

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    发表
    攻击者
    黑盒
    测试
    Gemma-4-31B、Gemma-4-12B、GPT-5.5 等 7 个

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    深度解读完整解读
  15. 攻击arXiv 2609.09553

    研究:任意密文攻击前沿大模型无需微调即可越狱

    提出任意字母置换密码越狱,无需微调即可诱导有害输出

    发表
    攻击者
    黑盒
    测试
    Gemini 3 Flash (preview)、Gemini 2.5 Flash、Claude Sonnet 4 等 7 个

    摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。

    深度解读完整解读
  16. 攻击arXiv 2609.10117

    研究揭示基于混淆的端侧 LLM 保护方案的安全边界

    提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型

    发表
    测试
    BERT-Base、ViT-Base、Qwen2.5-0.5B 等 4 个
    摘要Oprior 是四原语复合的安全边界,Collapse 利用列方向泄漏抽取替代模型,Oext 只被同一攻击评测。

    这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。

    深度解读完整解读