跳到正文
10月10日 · 周六

全部论文

找到 17 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.02569

    Pincer:用数字分身学习用户偏好并执行动态最小权限

    为 Agent 提出资源层授权系统 Pincer,用数字分身执行动态最小权限

    发表
    场景
    AI Agent
    被测模型
    Claude Haiku 4.5、Muse Spark 1.2 Contributor
    摘要Pincer 在资源层以三票合取做授权。

    Pincer 是加在现成 coding agent 上的资源层授权防御:用只受用户侧信息影响的 digital twin 做动态最小权限,并与 tool-call 层防御并存。要处理的是用户维护策略带来的权限蠕变和授权疲劳,以及不学习用户策略的 tool-call 分类器。作者引述工作称 auto mode 会放行多数不安全操作,并认为推理代码或复杂 shell 的效果在这一层不实际。

    深度解读完整解读
  2. 防御arXiv 2609.35659

    Tracekit:面向自主编码 Agent 的防篡改意图-推理-动作审计系统

    提出 Tracekit,审计编码 Agent 的意图、推理与动作并检测账本篡改

    发表
    被测模型
    Claude Code (claude -p, version 2.1)、独立评审(同一 CLI,无工具)
    摘要Tracekit 把意图、自述和动作写入可锚定的哈希链。

    Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。

    深度解读完整解读
  3. 防御arXiv 2609.34518

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    提出工具型 Agent 的自适应攻击 DART 与预执行防御 SAGE

    发表
    场景
    AI Agent
    被测模型
    GPT-5.6 Luna、GPT-5.6 Terra、Gemini 3.8 Flash 等 5 个

    摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。

    深度解读完整解读
  4. 风险行为arXiv 2609.30266

    研究显示 Claude Code、Codex 等本地智能体可轻易篡改自身执行轨迹

    测试编程智能体被诱导或自主篡改自身执行轨迹的行为

    发表
    被测模型
    GPT-5.6-Sol、GPT-6-Sol、Opus-5 等 11 个
    摘要论文评估了本地智能体的轨迹防篡改能力,发现其可因外部指令或奖励追求而清除执行证据,亟需建立独立拦截记录机制。

    这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。

    深度解读完整解读
  5. 防御arXiv 2609.28693

    skilder:以角色化技能包为工具型 LLM 智能体做访问控制

    提出 Skilder,按角色渐进下发企业工具并确定性拦截越权调用

    发表
    场景
    AI Agent
    被测模型
    Claude Haiku 4.5、Qwen 3.5 122B、Gemma 4 31B 等 6 个
    摘要Skilder 用单 MCP 服务器按角色交付工具并硬拦截。

    Skilder 把企业工具型智能体的能力按角色打包,经一个 MCP 服务器做渐进发现,使工具范围由服务器而不是提示词来执行。

    深度解读完整解读
  6. 防御arXiv 2609.24165

    APEXA 为同步辐射数据处理的 LLM 多智能体加装执行完整性护栏

    提出 APEXA,在工具层拒绝无执行支撑的结果并拦截电机命令

    发表
    被测模型
    GPT-5-mini、GPT-5.4、Claude Opus 4.7 等 4 个
    摘要作者称执行是否发生要由工具层核对,而不能只靠提示词。

    APEXA 是先进光子源上的数据还原框架,用工具层代码约束语言模型智能体的工具调用。

    深度解读完整解读
  7. 防御arXiv 2609.22573

    研究提出面向企业 MCP 的零信任授权与工具发现方案

    提出企业 MCP 零信任授权与发现扩展,在架构上拒绝提示注入下的越权调用

    发表
    场景
    AI Agent
    被测模型
    gpt-5、claude-sonnet-4-6、claude-opus-4-7 等 6 个
    摘要同一份按工具声明同时管 MCP 的发现、列表和调用,使注入不能扩大已有凭证的权限。

    作者把零信任放在 MCP 工具调用边界:智能体即使被提示注入,也不能调用其凭证范围之外的工具。问题来自三点部署性质。调用意图会随不可信上下文改变。

    深度解读完整解读
  8. 防御arXiv 2609.29647

    AgentKernel:面向 Agent 的可信原生操作系统内核

    提出 AgentKernel,用四支柱强制中介 Agent 的输入、工具与记忆

    发表
    场景
    AI Agent
    摘要AgentKernel 是四支柱智能体 OS 设计,安全论证未附带实测数字。

    AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。

    深度解读完整解读
  9. 攻击arXiv 2605.12673

    UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷

    提出 BENCHJACK,审计 Agent 基准中的奖励作弊缺陷

    发表
    场景
    AI Agent
    摘要论文系统揭示了智能体基准的奖励作弊隐患,提出自动化红队审计与迭代修补系统 BENCHJACK。

    论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。

    深度解读完整解读
已经到底了