跳到正文
10月10日 · 周六

全部论文

找到 13 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  2. 攻击arXiv 2610.07323

    ATLAS:用自适应信任域与主动学习搜索潜在对抗样本集

    提出 ATLAS 用水平集估计恢复黑盒分类器的对抗输入集合

    发表
    攻击者
    黑盒
    被测模型
    LeNet5、ResNet50 (CIFAR-10 standard)、ResNet50 (ImageNet standard) 等 5 个
    摘要ATLAS 用主动水平集估计构造黑盒对抗集,作者称其集合比单点攻击更具代表性。

    ATLAS 是一个查询式 black-box 框架,用来构造诱发失败的对抗输入集合,供鲁棒性审计使用。

    深度解读完整解读
  3. 攻击arXiv 2609.39607

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器

    提出 PRETEXT 攻击,迭代改写技能文本绕过技能扫描器并让 Agent 执行木马

    发表
    场景
    AI Agent
    攻击者
    白盒
    被测模型
    glm (z-ai/glm-5.1)、qwen3t (qwen/qwen3-235b-a22b-thinking-2507)、gpt-oss (openai/gpt-oss-120b)
    摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。

    深度解读完整解读
  4. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控

    发表
    场景
    AI Agent
    被测模型
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  5. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill,用跨技能组合绕过 Agent 技能扫描器

    发表
    攻击者
    黑盒、灰盒
    被测模型
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  6. 攻击arXiv 2605.26156

    BITE:用上下文赌博机操纵风格偏置攻击 LLM 评委

    提出 BITE,用上下文赌博机选择风格修改抬高 LLM 评委打分

    发表
    攻击者
    黑盒
    被测模型
    o3-mini、Gemini-2.5-Flash、Llama-3.3-70B-Instruct 等 8 个
    摘要BITE 用黑盒赌博机利用风格偏差抬分,作者称这对 LLM-as-a-judge 构成威胁。

    BITE 是黑盒风格操纵:在保持答案语义的同时,抬高 LLM 评审给出的分数。

    深度解读完整解读
  7. 攻击arXiv 2509.09112

    研究:字符级扰动可破坏 LLM 水印,并提出基于遗传算法的去除攻击

    提出字符级扰动与遗传算法去除 LLM 水印

    发表
    攻击者
    黑盒
    被测模型
    OPT-1.3B、LLaMA-3-8B
    摘要字符级扰动靠更大攻击范围移除水印。

    这篇工作评估推理时 LLM 水印在黑盒、有限查询下的移除难度,并比较字符级、token 级和句子级编辑。

    深度解读完整解读
  8. 攻击arXiv 2503.02174

    研究者提出对抗分词攻击,可在不改文本的情况下绕过 LLM 安全限制

    提出 AdvTok 对抗分词攻击,不改文本只改分词来越狱并规避安全分类器

    发表
    攻击者
    灰盒
    被测模型
    Llama3.2-1B、Llama3.2-3B、Llama3.1-8B 等 7 个
    摘要作者称非规范分词能躲开对齐并仍得到针对原请求的回复。

    作者用非规范分词攻击已对齐的子词 LLM:恶意字符串的字符不变,只改 token 边界。

    深度解读完整解读
已经到底了