跳到正文
10月10日 · 周六

全部论文

找到 137 篇

另有 378 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知

    发表
    被测模型
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  2. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作

    发表
    场景
    web agent
    被测模型
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  3. 防御arXiv 2610.08082

    POLAR:面向小型工具调用智能体的可逆性护栏框架

    提出 POLAR 本体门控,在执行前否决不可逆工具调用

    发表
    场景
    AI Agent
    被测模型
    qwen/qwen3-8b、meta-llama/llama-3.1-8b-instruct、nvidia/nemotron-nano-9b-v2 等 6 个
    摘要训练无关的事前可逆性门控,弱 airline 模型有收益,强模型与 retail 常回落。

    POLAR 是训练无关的事前门控,用类型化本体在工具调用执行前检查能否组成候选逆序列。

    深度解读完整解读
  4. 防御arXiv 2610.07657

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击

    发表
    被测模型
    Qwen3-235B-A22B-Instruct-2507、gpt-oss-120b、Llama-4-Scout-17B-16E-Instruct 等 5 个
    摘要DEFER 把确定性检查放在 judge 之前。

    DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。

    深度解读完整解读
  5. 攻击arXiv 2610.07645

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    提出 SkillPoison,用局部有效的成功经验诱导自进化 Agent 形成过度泛化技能

    发表
    场景
    AI Agent
    被测模型
    deepseek-v4-flash、Qwen V3.8 Flash、GPT-5.5
    摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。

    深度解读完整解读
  6. 评测与基准arXiv 2610.07359

    论文实测 Agent 工具调用门控栈的失败相关性

    提出 nmult 并评测 Agent 动作门禁堆叠的错误相关性

    发表
    场景
    AI Agent
    被测模型
    AgentTrust runtime (174 rules)、GPT-5.5 (gpt55)、claude-haiku-4-5-20251001 等 7 个
    摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。

    论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。

    深度解读完整解读
  7. 防御arXiv 2610.05162

    MemAdapter:用反事实适配缓解记忆诱发的谄媚

    提出 MemAdapter,在检索后约束记忆对智能体推理的影响

    发表
    场景
    AI Agent
    被测模型
    DeepSeek-V4-Flash、GPT-5.6-sol、Qwen3-8B
    摘要检索后三阶段调节记忆角色。

    MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。

    深度解读完整解读
  8. 防御arXiv 2610.04975

    论文提出长程智能体自生子目标的运行时授权机制

    提出长程工具智能体自生子目标的运行时授权机制

    发表
    场景
    AI Agent
    摘要用版本化目标图授权保住重规划,并挡住自生成子目标变成新权威。

    长时程工具使用把目标演化变成授权状态的一部分。本文在单 principal、单根、有限结构化域中,把自生成子目标的创建、替换、同根委托和同根 join 做成可检查转移,并在提交边界重查受保护效应。

    深度解读完整解读
  9. 防御arXiv 2610.04616

    PerturBot 用扰动训练打破视觉-语言-动作模型的模态捷径

    提出 Perturbot 扰动训练,打破 VLA 的模态捷径

    发表
    被测模型
    π0.5
    摘要Perturbot 改训练数据以削弱三类模态捷径,GroundFscore 用来看成功是否来自任务证据。

    Perturbot 是一套不改推理的 VLA 训练期数据干预,用来削弱模态捷径,并用离线分数区分“任务变好”和“靠捷径变好”。

    深度解读完整解读
  10. 攻击arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道

    发表
    场景
    AI Agent
    被测模型
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读