跳到正文
10月9日 · 周五

全部论文

找到 16 篇

另有 444 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.02005

    贝叶斯辩证论证(BDA):面向持续对抗下多 LLM 委员会的可校准聚合

    提出 BDA,把多 LLM 议会的辩证动作当可靠性证据做加权聚合

    发表
    摘要BDA 用零额外调用的可靠性加权,给出可校准后验,并在持续对抗下反转不可靠席位。

    BDA 是一种不另调 LLM 的多 LLM 议会聚合方法,同时处理置信度校准和持续不可靠席位。

    深度解读完整解读
  2. 防御arXiv 2610.00371

    FlowReview:以授权配对评测控制多智能体组合信息流

    提出 FlowReview,用对象解析与确定性提交门控制多智能体组合信息流

    发表
    摘要配对标准要求拒绝禁止使用并完成授权使用,FlowReview 把三项审查接到执行。

    这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。

    深度解读完整解读
  3. 防御arXiv 2608.30083

    研究者提出零知识谓词证明网关,在 MCP 与 Agent2Agent 上实现 Agent 间数据最小化

    提出零知识谓词证明网关,让 Agent 只交换谓词证明而不传敏感值

    发表
    摘要作者将 source integrity 而不是证明开销视为绑定约束。

    Proof Gateway 是一套已运行的智能体间数据最小化机制:用治理谓词的零知识证明代替原始值和自然语言自述。

    深度解读完整解读
  4. 攻击arXiv 2610.00392

    A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型

    提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据

    发表
    摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。

    A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。

    深度解读完整解读
  5. 防御arXiv 2609.01677

    Skill-as-API:面向智能体软件工程的机密多智能体协作协议

    提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词

    发表
    摘要协议把 skill 正文留在所有者侧,四层限制发现内容、权限期限和注入拼接。

    Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。

    深度解读完整解读
  6. 防御arXiv 2609.01931

    Agent Flight Recorder:为长时程工具调用智能体提供链上锚定的防篡改审计追踪

    提出 Agent Flight Recorder,为长时程工具智能体提供链上锚定的防篡改审计

    发表
    场景
    AI Agent
    摘要语义事件加哈希链、Merkle 与链上锚定,用来在争议中核验长程智能体的动作序列。

    Agent Flight Recorder 把长程工具智能体的动作收成可被第三方独立核验的审计记录,面向运营方本身可能改写历史的争议。

    深度解读完整解读
  7. 防御arXiv 2609.30824

    基于加密绑定身份验证能力令牌协调分布式 AI 智能体的提案

    提出身份绑定且只收窄的能力令牌,用上下文外钱包约束智能体

    发表
    摘要用只衰减的身份绑定令牌和上下文外钱包,约束代表人类行动的分布式智能体。

    代表人类行动的分布式智能体,需要一种不把密钥放进语言模型上下文的授权方式。

    深度解读完整解读
已经到底了