跳到正文
10月10日 · 周六

全部论文

找到 25 篇

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.11932

    复旦团队测量 AI 搜索引用脆弱性:普通发帖可进入引用与答案文本

    测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答

    发表
    被测模型
    Grok、Doubao、ChatGPT 等 10 个

    摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。

    深度解读完整解读
  2. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性

    发表
    被测模型
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  3. 攻击arXiv 2609.28613

    研究:提示注入可改变 Jev 决策模型的行动概率

    测量间接提示注入对类型化概率决策的动作劫持

    发表
    被测模型
    jev-1.13.0
    摘要封闭动作集改变提示注入的表现,但没有去掉概率被不可信内容移动的风险。

    作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。

    深度解读完整解读
  4. 防御arXiv 2609.11757

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出 AP2 支付协议的 Whisper 攻击与 A-VIP 绑定防御

    发表
    场景
    AI Agent
    被测模型
    gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个

    摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。

    深度解读完整解读
  5. 研究评测 14 个模型对不可靠工具的过度依赖

    用受控污染评测智能体对不可靠工具返回的过度依赖

    发表
    场景
    AI Agent
    被测模型
    Qwen3-235B、Qwen3-235B-Think、Qwen3-30B 等 15 个
    摘要三种工具的污染返回常被写入答案。

    作者评测 LLM 智能体是否会采纳不可靠的工具返回。现有工具基准多假定返回正确,而搜索综合、子智能体报告和代码执行都可能把错误内容交给智能体。评测只改答案相关内容。

    深度解读完整解读
  6. 攻击arXiv 2609.02774

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞

    发表
    被测模型
    Qwen 3.5 9B、Code Llama 13B、DeepSeek-Coder-V2 16B

    摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。

    深度解读完整解读
  7. Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息

    构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御

    发表
    被测模型
    Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout-17B-16E 等 8 个

    摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。

    深度解读完整解读
  8. 评测与基准arXiv 2608.16824

    GEO-Flag:检测与测量面向生成式引擎优化的网页内容

    提出 GEOFlagBench 与 IPT,检测并测量生成式引擎优化网页

    发表
    被测模型
    ModernBERT-base、Qwen3-0.6B、Gemini-3.5-flash 等 11 个
    摘要GEOFlagBench 与 IPT 用于检测 GEO 页,并估计真实检索中的占比与引用可核验性。

    GEO-Flag 把页面级 GEO 检测做成可评测任务,并在发布的检索结果上估计被判为 GEO 的页面占比。

    深度解读完整解读
  9. 攻击arXiv 2608.04565

    研究者提出 Breadcrumbing 长程攻击,可劫持 DeepResearch 类搜索 Agent 的证据链

    提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链

    发表
    场景
    web agent
    被测模型
    Qwen3.5-9B、Gemma4-31B、DeepResearch 等 7 个

    摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。

    深度解读完整解读
  10. 攻击arXiv 2608.00718

    研究揭示多智能体 LLM 流水线的结构性漏洞

    提出多智能体流水线的边界攻击,使对抗内容作为可信输入跨层传播

    发表
    被测模型
    GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5
    摘要缺边界校验使对抗内容跨智能体传播,作者称这是架构属性而非模型能力。

    作者把多智能体 LLM 流水线的对抗问题定义为缺少边界校验,并用生产轨迹和受控实验检查脆弱性来自架构还是骨干模型。中间输出未经验证就传给下游。作者认为,一旦某级接受对抗内容,后续智能体会把它当作可信输入。

    深度解读完整解读
  11. 防御arXiv 2607.12507

    研究者提出 RARE 攻击:LLM 辅助逆向工程中的表示混淆

    提出 RARE-Guard,阻止逆向观察被提升为指令或已验证声明

    发表
    场景
    AI Agent
    被测模型
    gpt-5.5、claude-sonnet-4-6、gemini-2.5-pro 等 5 个
    摘要成对二进制衡量无效提升。

    作者定义的失败是:LLM 辅助逆向中,忠实提取的二进制观察获得它并未赢得的指令权限、声明证据或可信状态。

    深度解读完整解读