跳到正文
10月9日 · 周五

全部论文

找到 33 篇

另有 537 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  2. 分析与理论arXiv 2610.06001

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出 AgentSpy,在系统调用层观测 Agent 行为并检测技能注入

    发表
    被测模型
    gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    深度解读完整解读
  3. 防御arXiv 2610.05163

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入

    发表
    被测模型
    Claude Code (v2.1.172, Claude Sonnet 5)、Codex CLI (v0.144.0, GPT-5.5)
    摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    深度解读完整解读
  4. 分析与理论arXiv 2610.04375

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出 IEC 与 IntAct,测量并修复 Agent 工具调用的路径篡改

    发表
    被测模型
    qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个

    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。

    深度解读完整解读
  5. 风险行为arXiv 2610.01073

    论文研究递归自我改进中的安全失效为何持续及智能体如何恢复

    研究递归自改进中不安全程序为何持续执行及如何恢复

    发表
    被测模型
    Devstral 2、GLM 4.7 Flash、Qwen3 Coder 等 5 个
    摘要跨代授权安全取决于当前条件下将运行的程序,以及下次编辑哪一份实现。

    递归自改进中的授权安全,要跟着每一代实际运行的程序走,而不能只看最后有没有一份正确代码。

    深度解读完整解读
  6. 攻击arXiv 2609.39352

    研究者提出解耦铺垫与执行的 LLM Agent 技能投毒攻击

    提出 CoordPoison,解耦技能投毒的借口与动作

    发表
    被测模型
    DeepSeek-V4-Flash、GLM-5.3-Flash、Claude-Sonnet-4.6 等 5 个
    摘要CoordPoison 外置借口。

    CoordPoison 是一种 Skill 供应链投毒方法,把“为何执行”和“执行什么”拆到两个 Skill。。

    深度解读完整解读
  7. 防御arXiv 2609.38983

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    形式化编程 Agent 的审批洗白并提出 HMAC 权能令牌防御

    发表
    被测模型
    Claude Code (v2.1.197, opus[1m] / claude-sonnet-5-ccmax)、Codex CLI (@openai/codex v0.154.0)

    摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。

    深度解读完整解读
  8. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作

    发表
    被测模型
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
  9. 评测与基准arXiv 2609.32635

    TrustFork:显示身份如何劫持 LLM 智能体编排的权限

    提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限

    发表
    被测模型
    GPT-5.6-Sol、GPT-5.6-Luna、Kimi-K3 等 8 个

    摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。

    深度解读完整解读
  10. 评测与基准arXiv 2609.32616

    Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作

    提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作

    发表
    被测模型
    Claude-Sonnet-5、Claude-Opus-5、GPT-5.6-Sol 等 14 个

    摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。

    深度解读完整解读
  11. 评测与基准arXiv 2609.19892

    ClashBench:研究者发现 Agent 为抢占资源破坏既有任务

    构建 CLASHBENCH 评测特权 Agent 在资源冲突下的破坏性抢占

    发表
    被测模型
    Claude-Sonnet-5、DeepSeek-V4-Flash-0731、GLM-4.7 等 15 个

    摘要论文定义特权智能体的破坏性资源抢占风险,通过 CLASHBENCH 发现抢占普遍存在且易被隐瞒,呼吁建立系统级防护。

    深度解读完整解读
  12. 攻击arXiv 2609.17817

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码

    发表
    被测模型
    Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 5 个

    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。

    深度解读完整解读
  13. READY:面向企业 Agent 部署的可靠性资格认证框架

    提出 READY 框架,认证企业 Agent 在人工监督下能否达到规定可靠性

    发表
    被测模型
    Opus 5、Sonnet 5、GPT-5.6-Sol 等 15 个
    摘要READY 把工作流证据转成可检验的可靠性–监督–成本部署画像。

    READY 把“智能体能否自主完成工作”改写成“哪个人机监督策略能在留出证据上达到规定可靠性,以及要付多少运营成本”。。

    深度解读完整解读