DAEDALUS:用自生成任务自举 Agent 记忆
提出 DAEDALUS,用自生成任务自举 Agent 记忆
- arXiv
- 2610.08048
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- GPT-5.4-mini、GPT-5.6 Luna、Qwen3.6-35B-A3B 等 11 个
- 组件记忆
提出 DAEDALUS,用自生成任务自举 Agent 记忆
提出 AI Agent 主张的可审计性框架与裁决规则
作者给出把关于已部署智能体的主张写成可核查陈述的条件,而不是检测器或攻击方法。
主张多模态安全评测应衡量可控性,并用 SAE 建立四轴画像
作者主张多模态安全评测在行为分类之外,单独报告可控性画像,而不是把检测准确当成控制证据。
提出 Geodesic Unlearning,沿测地线编辑权重以提升缺模态鲁棒性
这项工作讨论多模态模型在部署时整段缺一个模态的性能下降,并把校正写成训练后的子空间编辑。
提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算
P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。
提出 WebFovea,加固视觉网页智能体的解析、执行、反馈与观察往返
提出 FAO 框架,形式化隐私约束下的分布式智能体协同优化
Federated Agent Optimization(FAO) 是一篇框架论文:多个处在私有环境中的 LLM 智能体,如何在原始数据、完整轨迹和本地知识不离开客户端的前提下协作改进。
研究视觉语言模型在协作中能否表示并说出指称不确定性
摘要指称不确定性可被引出,但很少说出来。
提出 statepoint 运行时,一致回滚并分支 Agent 的本地与远程状态
Planarian 是与现有 harness 协同的运行时,把智能体环境收成可恢复、可分支的时间点。
形式化视频透视头显中系统截图与人眼视野的错配
作者提出 Issuer-Sovereign Agentic Payments,由发卡行决定是否生成认证值。论文无实验。
Issuer-Sovereign Agentic Payments 把智能体消费限额留在发卡行认证步骤里,而不是在扣款时依赖银行外的 credential provider。
提议前沿开发者托管嵌入式评估,审查内部智能体监控、权限与对齐
嵌入式评估是一种第三方评估:独立评估者在前沿 AI 开发者现场获得接近员工的系统、人员与文档访问,用来审查依赖内部系统与实践的风险。
提出弹性沙箱基础设施 DSec,支撑大规模智能体训练
DSec 是 DeepSeek-AI 的生产沙箱平台,用来支撑从 DeepSeek V3.2 到 V4.1 的智能体 RL 与评测,而不是报告某个模型的任务准确率。
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
综述自主渗透智能体的继承攻击、架构攻击及护栏缺口
这是一篇关于自主 AI 渗透测试智能体的安全综述:用架构和生命周期两轴整理威胁与护栏,不做新的攻击实验。
综述工具调用 Agent 的授权架构,提出主体层级与结构要求
这是一篇关于工具调用型智能体授权架构的结构化叙事综述,分析单位是每一次使模型之外系统产生效果的调用。
系统梳理智能体执行链路中的越狱攻击与防御并比较推理时防御
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
提出内核管理共享记忆抽象,统一多智能体的检索、隐私过滤与注入
kernel-managed shared memory 把多智能体的检索、隐私和注入收进 agent-system kernel,并在 AIOS 上与三种替代方案比较。
提出结合 Scientist AI 监督与系统级控制的智能体保障架构
Lu 与 Bengio 给出的是一套可逐层上移的保障架构和一组事件归类,不是已测量的防御系统。
提出离线两阶段框架,诊断易翻转步骤并生成记忆指南以稳定智能体
作者要缩小的是 LLM 智能体平均通过、重复不稳之间的 consistency gap,即 Mean@k 减 Passˆk。