跳到正文
10月10日 · 周六

全部论文

找到 8 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 196 篇还没打标签,不在筛选结果里。

另有 196 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.38983

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    形式化编程 Agent 的审批洗白并提出 HMAC 权能令牌防御

    发表
    被测模型
    Claude Code (v2.1.197, opus[1m] / claude-sonnet-5-ccmax)、Codex CLI (@openai/codex v0.154.0)

    摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。

    深度解读完整解读
  2. 防御arXiv 2609.17648

    多智能体 LLM 流水线中的信任传播与结构隔离

    用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行

    发表
    被测模型
    gemma4:31b-cloud
    摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。

    作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。

    深度解读完整解读
  3. 防御arXiv 2609.15803

    研究者提出 k-robust 联盟对齐,用多智能体评审委托授权

    提出 k-robust 联盟对齐,刻画误对齐评审下的安全委托授权

    发表
    摘要联盟覆盖使无个体对齐的评审面板仍可相对基线安全授权,数值分数改善完备性。

    委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。

    深度解读完整解读
  4. MasDrift:跨多智能体架构的授权保持基准

    提出 MasDrift,评测多智能体在良性任务中的授权保持

    发表
    被测模型
    DeepSeek V4 Flash、Qwen3.7 Plus、GPT-5.4 Nano 等 6 个
    摘要授权保持可被测量:层级用未授权动作换完成率,重锚定比沿链携带更稳。

    MasDrift 把多智能体设计中的授权保持做成可测量性质,对象是没有攻击者的普通委托。

    深度解读完整解读
  5. 攻击arXiv 2605.08460

    论文建模多智能体网络中的子智能体继承攻击面

    建模并利用多智能体网络中子智能体生成时的记忆继承漏洞

    发表
    被测模型
    MiniMax M2.5、Llama-4-Maverick-17B-128E-Instruct-FP8、Qwen3.5-Plus 等 5 个
    摘要形式化子智能体继承,在 OpenClaw 上演示四类编排层漏洞并提出防御。

    作者对多智能体网络里的子智能体继承做形式化分析,并用开源框架上的 PoC 演示编排层如何让单点妥协继续扩散。

    深度解读完整解读
已经到底了