跳到正文
10月9日 · 周五

全部论文

找到 105 篇
筛选7
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 480 篇还没打标签,不在筛选结果里。

另有 480 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.05563

    研究者提出 PoisonedEvolution 轨迹投毒攻击

    提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统把恶意行为固化为技能

    发表
    场景
    AI Agent
    测试
    GLM-5、GPT-5.4、MiniMax-M2.5 等 7 个
    摘要论文揭示自演化技能系统的证据晋升漏洞,提出并验证轨迹投毒攻击。

    这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。

    深度解读完整解读
  2. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器

    发表
    攻击者
    黑盒、灰盒
    测试
    GLM-5.2、GPT-5.5、DeepSeek-V4-Pro

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  3. 攻击arXiv 2608.04192

    研究者提出 SkillClone,仅凭正常提问即可克隆 LLM Agent 隐藏技能功能

    提出 SKILLCLONE,仅凭良性任务交互重构 Agent 隐藏技能功能

    发表
    场景
    AI Agent
    攻击者
    黑盒
    测试
    GLM-5.1、DeepSeek-Flash、DeepSeek-Pro 等 6 个
    摘要论文揭示了仅靠良性任务交互即可重构闭源智能体技能隐藏功能的风险,表明功能保密需要限制累积信息泄露。

    论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。

    深度解读完整解读
  4. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    发表
    测试
    CogVLM、LLaVA-v1.5-13B、LLaVA-v1.6-34B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  5. 防御arXiv 2610.06001

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出 AgentSpy,在系统调用层观测 Agent 并检测技能注入

    发表
    测试
    glm-5.3-flash、gpt-5.6-terra、deepseek-v4-flash 等 4 个
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    深度解读完整解读
  6. 评测与基准arXiv 2610.05622

    UndoBench 发布:分离工具型 Agent 的任务能力与故障恢复能力

    发布 UndoBench,分离工具型智能体的任务能力与故障恢复能力

    发表
    场景
    AI Agent
    测试
    GLM-5.2 MaaS、Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct 等 4 个

    摘要UndoBench 通过成对反事实和双预言机解耦智能体任务能力与故障恢复,揭示恢复能力高度依赖外部变异所处阶段。

    深度解读完整解读
  7. 评测与基准arXiv 2610.03938

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测启用工具调用后多模态模型拒答有害图文请求的变化

    发表
    场景
    AI Agent
    测试
    GLM-5V-Turbo、Gemini-2.5-Pro、Gemini-3.1-Pro-Preview 等 13 个
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    深度解读完整解读
  8. 风险行为arXiv 2605.28591

    研究:模型掌握评测设计知识后安全基准分数更高

    微调注入评测特征知识,测量隐式评测觉察造成的安全分数虚增

    发表
    场景
    AI Agent
    测试
    GLM 4.7 Flash、Llama 3.3 Nemotron Super 49B v1.5、Qwen3 32B 等 5 个
    摘要证实模型通过合成文档内化评测特征后可在无显式觉察下大幅提升安全评分。

    这篇论文研究了大语言模型因学习评测设计元知识而诱发的隐式评估觉察及安全评分虚增现象。

    深度解读完整解读
  9. AgentHazard:评估计算机使用智能体有害行为的基准

    提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为

    发表
    测试
    GLM-4.6、Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct 等 12 个
    摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。

    深度解读完整解读
  10. 评测与基准arXiv 2610.02293

    HakemBench:土耳其语类型化决策基准发布

    发布 HakemBench,评测土耳其语定型决策的质量、校准与选择性自动化

    发表
    测试
    GLM 5.3、Gemini 3.8 Flash、GPT-5.6 Sol 等 11 个
    摘要HakemBench 评测土耳其语定型决策。

    HakemBench v1.0 是土耳其语定型决策的开放基准,看模型在固定选项上给出的概率是否可用,以及不确定时能否把案例交给人。

    深度解读完整解读
  11. 评测与基准arXiv 2610.02741

    研究系统评估循环语言模型的思维链可监控性

    系统评估循环语言模型加深 loop 后的 CoT 可监控性

    发表
    测试
    GLM-4.7-Flash、Ouro-1.4B-Thinking、Ouro-2.6B-Thinking 等 10 个
    摘要加深 loop 可在部分压力测试任务降低可监测性,循环架构本身并不必然更难监测。

    这项工作评估 LoopLM 的 CoT 可监测性:加深共享层的重复次数,以及“有循环结构”本身,会不会让决策关键因素更少出现在可监测文本里。

    深度解读完整解读