防御arXiv 2609.17648·9月15日多智能体 LLM 流水线中的信任传播与结构隔离提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行arXiv2609.17648发表9月15日层应用层场景多智能体防御权限与审批攻击投毒与后门组件权限与沙箱+2+2摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。深度解读完整解读
防御arXiv 2609.35659·9月29日Tracekit:面向自主编码 Agent 的防篡改意图-推理-动作审计系统提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计arXiv2609.35659发表9月29日层应用层场景编程 Agent被测模型Claude Code (claude -p, version 2.1)、独立评审(同一 CLI,无工具)防御监控与审计攻击提示注入风险Agent 危险操作组件监控器+3+3摘要Tracekit 把意图、自述和动作写入可锚定的哈希链。Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。深度解读完整解读