跳到正文
10月8日 · 周四

全部论文

找到 10 篇

另有 989 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.04375

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出 IEC 协议与 IntAct,定位并修复工具调用执行路径的静默篡改

    发表
    测试
    qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个

    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。

    深度解读完整解读
  2. 防御arXiv 2609.12001

    Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作

    提出 OATS,用确定性解析器在运行时治理技能动作

    发表
    测试
    Claude Sonnet 5、GPT-5.5、gpt-5-mini 等 4 个

    摘要论文论证了发布时恶意扫描无法替代运行时动作许可控制,提出了轻量确定性控制门 OATS,展示了双层防御组合的必要性。

    深度解读完整解读
  3. 防御arXiv 2609.33039

    TACIT:从 LLM 内部状态检测 Agent 轨迹危害

    提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹

    发表
    场景
    AI Agent
    测试
    Qwen3Guard-4B、LlamaGuard3-8B、AgentDoG-4B 等 9 个

    摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。

    深度解读完整解读
  4. 防御arXiv 2609.38983

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    提出 Approval Token 绑定编程智能体的审批与执行

    发表
    测试
    Claude Code (v2.1.197, opus[1m] / claude-sonnet-5-ccmax)、Codex CLI (@openai/codex v0.154.0)

    摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。

    深度解读完整解读
  5. 防御arXiv 2607.13716

    CAVA:面向智能体 AI 运行时治理的规范动作验证与证明

    提出 CAVA,把异构智能体运行时事件规范成可哈希动作并绑定审批与回执

    发表
    场景
    AI Agent
    摘要CAVA 用规范动作指纹承接异构运行时治理。

    CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。

    深度解读完整解读
  6. 防御arXiv 2609.08258

    研究实测五套 Agent 记忆系统均不执行撤销标记

    评测智能体记忆软撤回是否生效,并提出陈旧检索防护

    发表
    场景
    AI Agent
    测试
    GPT-5.5、Grok-4、DeepSeek-V4-Flash 等 9 个

    摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。

    深度解读完整解读
  7. 防御arXiv 2606.20023

    ToolPrivBench:LLM Agent 在低权限工具足够时仍倾向选择高权限工具

    构建 TOOLPRIVBENCH 评测 Agent 的过度特权选择并提出特权感知后训练

    发表
    场景
    AI Agent
    测试
    Qwen3-8B、LLaMA-3.1-8B、MiniMax-M2.7 等 15 个
    摘要TOOLPRIVBENCH 显示过度特权选工具普遍,常规对齐迁移有限,特权感知后训练可降低 OPUR。

    作者研究 LLM 智能体的 over-privileged tool selection:低权限工具已经足够时,仍选择或在短暂失败后升级到高权限工具。

    深度解读完整解读
已经到底了