DAEDALUS:用自生成任务自举 Agent 记忆
提出 DAEDALUS,用自生成任务自举 Agent 记忆
- arXiv
- 2610.08048
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- GPT-5.4-mini、GPT-5.6 Luna、Qwen3.6-35B-A3B 等 11 个
- 组件记忆
提出 DAEDALUS,用自生成任务自举 Agent 记忆
提出 AI Agent 主张的可审计性框架与裁决规则
作者给出把关于已部署智能体的主张写成可核查陈述的条件,而不是检测器或攻击方法。
审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决
作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。
提出 FAO 框架,形式化隐私约束下的分布式智能体协同优化
Federated Agent Optimization(FAO) 是一篇框架论文:多个处在私有环境中的 LLM 智能体,如何在原始数据、完整轨迹和本地知识不离开客户端的前提下协作改进。
提出 statepoint 运行时,一致回滚并分支 Agent 的本地与远程状态
Planarian 是与现有 harness 协同的运行时,把智能体环境收成可恢复、可分支的时间点。
作者提出 Issuer-Sovereign Agentic Payments,由发卡行决定是否生成认证值。论文无实验。
Issuer-Sovereign Agentic Payments 把智能体消费限额留在发卡行认证步骤里,而不是在扣款时依赖银行外的 credential provider。
提议前沿开发者托管嵌入式评估,审查内部智能体监控、权限与对齐
嵌入式评估是一种第三方评估:独立评估者在前沿 AI 开发者现场获得接近员工的系统、人员与文档访问,用来审查依赖内部系统与实践的风险。
提出弹性沙箱基础设施 DSec,支撑大规模智能体训练
DSec 是 DeepSeek-AI 的生产沙箱平台,用来支撑从 DeepSeek V3.2 到 V4.1 的智能体 RL 与评测,而不是报告某个模型的任务准确率。
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
综述自主渗透智能体的继承攻击、架构攻击及护栏缺口
这是一篇关于自主 AI 渗透测试智能体的安全综述:用架构和生命周期两轴整理威胁与护栏,不做新的攻击实验。
综述工具调用 Agent 的授权架构,提出主体层级与结构要求
这是一篇关于工具调用型智能体授权架构的结构化叙事综述,分析单位是每一次使模型之外系统产生效果的调用。
系统梳理智能体执行链路中的越狱攻击与防御并比较推理时防御
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
提出内核管理共享记忆抽象,统一多智能体的检索、隐私过滤与注入
kernel-managed shared memory 把多智能体的检索、隐私和注入收进 agent-system kernel,并在 AIOS 上与三种替代方案比较。
提出结合 Scientist AI 监督与系统级控制的智能体保障架构
Lu 与 Bengio 给出的是一套可逐层上移的保障架构和一组事件归类,不是已测量的防御系统。
提出离线两阶段框架,诊断易翻转步骤并生成记忆指南以稳定智能体
作者要缩小的是 LLM 智能体平均通过、重复不稳之间的 consistency gap,即 Mean@k 减 Passˆk。
用 SAVER 框架综述自演化智能体的状态复用安全
SAVER 是一篇关于自演化智能体安全的转移中心综述:安全对象从单次回答或单次授权动作,转到可复用状态在多次转移中的谱系。
提出以协调情节为单位遏制智能体协同入侵的准则
摘要立场是跨执行保留关系并约束共享状态。
部署方侧的两层证明,用来在多智能体跨部署方委托之后回答两个事后问题:谁放出了这些字节,这条跨部署方边有没有父方授权。