跳到正文
10月9日 · 周五

全部论文

找到 203 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 480 篇还没打标签,不在筛选结果里。

另有 480 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.37468

    论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法

    提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门

    发表
    场景
    AI Agent
    测试
    E5、Contriever-MSMARCO、Qwen2.5-7B-Instruct

    摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。

    深度解读完整解读
  2. 攻击arXiv 2608.04565

    研究者提出 Breadcrumbing 长程攻击,可劫持 DeepResearch 类搜索 Agent 的证据链

    提出权威链劫持 ACH 与策略演化 TGSE,劫持搜索 Agent 的证据链

    发表
    场景
    AI Agent
    测试
    Qwen3.5-9B、Gemma4-31B、DeepResearch 等 8 个

    摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。

    深度解读完整解读
  3. 攻击arXiv 2606.09700

    研究者提出 HPAA 攻击:用排版视觉线索绕过 13 个内容审核系统

    提出 HPAA 攻击,用排版视觉线索绕过内容审核系统

    发表
    攻击者
    黑盒
    测试
    Llama-Guard-3-8B、Perspective API、ShieldGemma-2B 等 13 个
    摘要揭示了排版视觉线索与分词差异带来的审核盲区,HPAA 以极低查询实现近乎完全规避。

    这篇论文研究了人类视觉感知与大模型分词处理机制之间的差异所导致的内容审核漏洞。

    深度解读完整解读
  4. 攻击arXiv 2608.05563

    研究者提出 PoisonedEvolution 轨迹投毒攻击

    提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统把恶意行为固化为技能

    发表
    场景
    AI Agent
    测试
    GPT-5.4、MiniMax-M2.5、DeepSeek-V3.2 等 7 个
    摘要论文揭示自演化技能系统的证据晋升漏洞,提出并验证轨迹投毒攻击。

    这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。

    深度解读完整解读
  5. 攻击arXiv 2607.14493

    LogInject 框架披露 LLM 日志分析中的被动提示注入

    提出 LogInject 框架,评测日志分析中的被动提示注入及缓解

    发表
    测试
    GPT-4o、Claude 3.5 Sonnet、Llama-3-70B-Instruct

    摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。

    深度解读完整解读
  6. 攻击arXiv 2606.04329

    研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准

    系统研究 LLM 智能体记忆投毒并构建基准 MPBench

    发表
    场景
    AI Agent
    测试
    GPT-OSS-120B、Meta-Llama-3.1-70B-Instruct、Deberta-v3-base 等 6 个

    摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。

    深度解读完整解读
  7. 评测与基准arXiv 2610.07939

    CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出

    提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别

    发表
    测试
    C2P-CLIP、ForgeLens、D3-Im 等 13 个

    摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。

    深度解读完整解读
  8. 防御arXiv 2609.38909

    Purdue 提出 Pact:将欺骗作为行为遗忘

    提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解

    发表
    攻击者
    白盒
    测试
    DeepSeek-R1-Distill-Qwen-32B、QwQ-32B

    摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。

    深度解读完整解读
  9. 攻击arXiv 2610.09819

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门

    发表
    测试
    HuBERT-base、WavLM-base

    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    深度解读完整解读
  10. 分析与理论arXiv 2610.08144

    新论文称 Lean 验证不能为 OpenAI 的 Navier-Stokes 自然语言证明背书

    论证 Lean 编译通过不能保证自然语言数学证明语义忠实

    发表
    测试
    ChatGPT-6 (Astra Ultra)、OpenAI Navier-Stokes formalisation AI、Meta Atlas autoformaliser

    摘要论文论证了形式化编译不保证原证明正确,确立了消歧不可计算性理论,并揭示了 OpenAI 爆破证明中的具体脱节。

    深度解读完整解读
  11. 防御arXiv 2609.11757

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策

    发表
    场景
    AI Agent
    测试
    gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个

    摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。

    深度解读完整解读
  12. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    测试
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B 等 4 个

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  13. 评测与基准arXiv 2610.10276

    PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤

    提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤

    发表
    测试
    Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it 等 8 个

    摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。

    深度解读完整解读
  14. 风险行为arXiv 2610.08670

    研究:后训练配方决定大模型是否违背自身道德判断行事

    提出知行差距面板,测量压力下模型是否违背自身判断

    发表
    测试
    OLMo-3-7B-Instruct、Llama-3.1-8B-Instruct、Tulu 3 等 7 个
    摘要评估发现后训练配方决定知行差距是否存在,行动前审思可有效缓解。

    本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。

    深度解读完整解读