跳到正文
10月9日 · 周五

全部论文

找到 4 篇

另有 558 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.37468

    论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法

    提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门

    发表
    场景
    AI Agent
    测试
    E5、Contriever-MSMARCO、Qwen2.5-7B-Instruct

    摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。

    深度解读完整解读
  2. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器

    发表
    攻击者
    黑盒、灰盒
    测试
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  3. 攻击arXiv 2609.39607

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器

    提出 PRETEXT 白盒攻击,迭代改写技能文本以绕过 Agent 技能扫描器

    发表
    场景
    AI Agent
    攻击者
    白盒
    测试
    glm (z-ai/glm-5.1)、qwen3t (qwen/qwen3-235b-a22b-thinking-2507)、gpt-oss (openai/gpt-oss-120b) 等 4 个
    摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。

    深度解读完整解读
  4. 攻击arXiv 2609.19722

    ALIBI:向二进制注入虚假安全叙事可让 LLM 恶意软件分析器误判

    提出 ALIBI,向恶意二进制注入不执行掩护叙事使分析器误判为良性

    发表
    攻击者
    黑盒
    测试
    Gemini 2.5 Pro、GPT-5.5 Pro、Claude Opus 4.7 等 4 个
    摘要ALIBI 用二进制内的掩护叙事重释可疑静态证据,Gemini 上翻转多,另两模型主要为降级。

    ALIBI 是针对 LLM 恶意软件分诊的语义掩护叙事攻击:不覆盖系统指令,而把仍可见的可疑静态证据重释成良性安全产品的预期行为。

    深度解读完整解读
已经到底了