跳到正文
10月10日 · 周六

全部论文

找到 43 篇

另有 240 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.09944

    AgentTime 基准测试智能体时长遵循能力,GPT-6 Astra 出现 14 次做完后休眠

    提出 AgentTime 基准,评测智能体按时长工作与估时能力

    发表
    被测模型
    Fable 5.1、GPT-5.6 Sol、GPT-6 Astra 等 7 个
    摘要作者把完成任务和管理所用时间分开。

    AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。

    深度解读完整解读
  2. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  3. 评测与基准arXiv 2610.08662

    ParanoiaEval:编码智能体不必要风险处置评测基准发布

    提出 ParanoiaEval 评测编码智能体的不必要风险处置

    发表
    被测模型
    Opus-5、Sonnet-5、Sonnet-4.6 等 8 个
    摘要作者用证据受控任务对评测风险处置,称其普遍、独立于任务能力并降低满意度。

    作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。

    深度解读完整解读
  4. 分析与理论arXiv 2610.06001

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出 AgentSpy,在系统调用层观测 Agent 行为并检测技能注入

    发表
    被测模型
    gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    深度解读完整解读
  5. 防御arXiv 2610.05163

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入

    发表
    被测模型
    Claude Code (v2.1.172, Claude Sonnet 5)、Codex CLI (v0.144.0, GPT-5.5)
    摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    深度解读完整解读
  6. 分析与理论arXiv 2610.04375

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出 IEC 与 IntAct,测量并修复 Agent 工具调用的路径篡改

    发表
    被测模型
    qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个

    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。

    深度解读完整解读
  7. 风险行为arXiv 2610.01073

    论文研究递归自我改进中的安全失效为何持续及智能体如何恢复

    研究递归自改进中不安全程序为何持续执行及如何恢复

    发表
    被测模型
    Devstral 2、GLM 4.7 Flash、Qwen3 Coder 等 5 个
    摘要跨代授权安全取决于当前条件下将运行的程序,以及下次编辑哪一份实现。

    递归自改进中的授权安全,要跟着每一代实际运行的程序走,而不能只看最后有没有一份正确代码。

    深度解读完整解读
  8. 攻击arXiv 2609.39352

    研究者提出解耦铺垫与执行的 LLM Agent 技能投毒攻击

    提出 CoordPoison,解耦技能投毒的借口与动作

    发表
    被测模型
    DeepSeek-V4-Flash、GLM-5.3-Flash、Claude-Sonnet-4.6 等 5 个
    摘要CoordPoison 外置借口。

    CoordPoison 是一种 Skill 供应链投毒方法,把“为何执行”和“执行什么”拆到两个 Skill。。

    深度解读完整解读
  9. 防御arXiv 2609.38983

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    形式化编程 Agent 的审批洗白并提出 HMAC 权能令牌防御

    发表
    被测模型
    Claude Code (v2.1.197, opus[1m] / claude-sonnet-5-ccmax)、Codex CLI (@openai/codex v0.154.0)

    摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。

    深度解读完整解读
  10. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作

    发表
    被测模型
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
  11. 评测与基准arXiv 2609.32635

    TrustFork:显示身份如何劫持 LLM 智能体编排的权限

    提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限

    发表
    被测模型
    GPT-5.6-Sol、GPT-5.6-Luna、Kimi-K3 等 8 个

    摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。

    深度解读完整解读
  12. 评测与基准arXiv 2609.32616

    Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作

    提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作

    发表
    被测模型
    Claude-Sonnet-5、Claude-Opus-5、GPT-5.6-Sol 等 14 个

    摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。

    深度解读完整解读