跳到正文
10月10日 · 周六

全部论文

找到 23 篇

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.11932

    复旦团队测量 AI 搜索引用脆弱性:普通发帖可进入引用与答案文本

    测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答

    发表
    被测模型
    Grok、Doubao、ChatGPT 等 10 个

    摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。

    深度解读完整解读
  2. 防御arXiv 2610.03089

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击

    发表
    被测模型
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个

    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    深度解读完整解读
  3. 防御arXiv 2610.02569

    Pincer:用数字分身学习用户偏好并执行动态最小权限

    为 Agent 提出资源层授权系统 Pincer,用数字分身执行动态最小权限

    发表
    场景
    AI Agent
    被测模型
    Claude Haiku 4.5、Muse Spark 1.2 Contributor
    摘要Pincer 在资源层以三票合取做授权。

    Pincer 是加在现成 coding agent 上的资源层授权防御:用只受用户侧信息影响的 digital twin 做动态最小权限,并与 tool-call 层防御并存。要处理的是用户维护策略带来的权限蠕变和授权疲劳,以及不学习用户策略的 tool-call 分类器。作者引述工作称 auto mode 会放行多数不安全操作,并认为推理代码或复杂 shell 的效果在这一层不实际。

    深度解读完整解读
  4. 防御arXiv 2609.35659

    Tracekit:面向自主编码 Agent 的防篡改意图-推理-动作审计系统

    提出 Tracekit,审计编码 Agent 的意图、推理与动作并检测账本篡改

    发表
    被测模型
    Claude Code (claude -p, version 2.1)、独立评审(同一 CLI,无工具)
    摘要Tracekit 把意图、自述和动作写入可锚定的哈希链。

    Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。

    深度解读完整解读
  5. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse

    发表
    场景
    AI Agent
    被测模型
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 15 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
  6. 防御arXiv 2609.05901

    KITA:为 LLM Agent 设计密钥隔离的阈值签名授权架构

    提出 KITA,把 Agent 批准绑定到规范动作的密钥隔离阈值签名

    发表
    场景
    AI Agent
    摘要KITA 把隔离的阈值签名当作精确动作的执行条件,并测量门控、相关性与签名开销。

    KITA 是一套密钥隔离的阈值授权架构,用来把模型评审变成执行外部动作的条件。

    深度解读完整解读
  7. 攻击arXiv 2609.02774

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞

    发表
    被测模型
    Qwen 3.5 9B、Code Llama 13B、DeepSeek-Coder-V2 16B

    摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。

    深度解读完整解读
  8. Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息

    构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御

    发表
    被测模型
    Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout-17B-16E 等 8 个

    摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。

    深度解读完整解读
  9. Mind2Web-Injection:面向网页 Agent 视觉提示注入护栏的证据对齐评测

    提出 Mind2Web-Injection 评测网页 Agent 视觉注入护栏

    发表
    被测模型
    GPT-5.6-luna、Qwen3-VL-32B、Qwen3-VL-8B 等 6 个
    摘要作者称检测、定位和反事实响应在六个 VLM 上可分开。

    Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。

    深度解读完整解读
  10. 评测与基准arXiv 2608.16824

    GEO-Flag:检测与测量面向生成式引擎优化的网页内容

    提出 GEOFlagBench 与 IPT,检测并测量生成式引擎优化网页

    发表
    被测模型
    ModernBERT-base、Qwen3-0.6B、Gemini-3.5-flash 等 11 个
    摘要GEOFlagBench 与 IPT 用于检测 GEO 页,并估计真实检索中的占比与引用可核验性。

    GEO-Flag 把页面级 GEO 检测做成可评测任务,并在发布的检索结果上估计被判为 GEO 的页面占比。

    深度解读完整解读
  11. 防御arXiv 2608.06422

    CMU 研究:分片判断可避免 LLM 监督失效并抵御对抗利用

    提出分片监督,将评判标准分配给独立调用以抵御展示攻击

    发表
    攻击者
    黑盒
    被测模型
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Opus 4.6 等 4 个
    摘要论文揭示决策负载是大模型监督的独立瓶颈,提出分片与辩论机制有效分离注意力与平衡证据,在多项高难度基准上实现稳健评判。

    本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。

    深度解读完整解读
  12. 攻击arXiv 2608.04565

    研究者提出 Breadcrumbing 长程攻击,可劫持 DeepResearch 类搜索 Agent 的证据链

    提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链

    发表
    场景
    web agent
    被测模型
    Qwen3.5-9B、Gemma4-31B、DeepResearch 等 7 个

    摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。

    深度解读完整解读
  13. 防御arXiv 2607.13716

    CAVA:面向智能体 AI 运行时治理的规范动作验证与证明

    提出 CAVA,将异构智能体运行时事件规范为可哈希动作并绑定审批与回执

    发表
    场景
    AI Agent
    摘要CAVA 用规范动作指纹承接异构运行时治理。

    CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。

    深度解读完整解读