跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 19 篇
筛选

模型自身风险

系统组件

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 383 篇还没打标签,不在筛选结果里。

另有 285 篇还没有研究类型,暂不在这些分类里。

  1. 其他arXiv:2607.28568 ·

    Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型

    提出 OpenMLE 全栈,用执行反馈后训练机器学习元进化智能体

    编程 Agent测试Frontis-MA1-35B、Qwen3.6-35B-A3B、Frontis-MA1-30B 等 15 个训练与数据层
    摘要OpenMLE 训练 Frontis-MA1-35B,用四个共享算子把 MLE 后训练和长程搜索接成元进化闭环。

    作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。

    完整解读
  2. 其他arXiv:2610.01195 ·

    Federated Agent Optimization:面向隐私约束下分布式智能体协同优化的联邦智能体优化框架

    提出 FAO 框架,形式化隐私约束下的智能体协同优化

    摘要FAO 把智能体协作写成效用、隐私和通信的多目标问题,并给出组件分类与迁移框架。

    Federated Agent Optimization(FAO) 是一篇框架论文:多个处在私有环境中的 LLM 智能体,如何在原始数据、完整轨迹和本地知识不离开客户端的前提下协作改进。

    完整解读
  3. 其他arXiv:2609.22978 ·

    DeepSeek Elastic Compute(DSec):面向大规模智能体训练的高效沙箱基础设施

    AI 导读DeepSeek 发布生产级沙箱平台 DSec,通过统一 SDK 提供 FnCall、容器、microVM 和 full-VM 四类沙箱后端,并与强化学习框架协同设计,将带状态的 rollout 执行与可抢占的 GPU 训练解耦,同时缓解奖励作弊等智能体失范行为。

    摘要DSec 是面向大规模智能体 RL 的多后端生产沙箱,用分层、按需镜像和训练协同维持高密度。

    DSec 是 DeepSeek-AI 的生产沙箱平台,用来支撑从 DeepSeek V3.2 到 V4.1 的智能体 RL 与评测,而不是报告某个模型的任务准确率。

    完整解读
  4. 其他arXiv:2609.39982 ·

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    Mid-Harness 在执行前用验证器从同一生成器的候选动作中选出一个再交给 harness。

    测试TMAX-9B、TMAX-4B、TMAX-27B 等 8 个
    摘要Mid-Harness 在执行前选择候选动作。

    Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。

    完整解读
  5. 其他arXiv:2609.38807 ·

    PatchHolmes:基于列表式选择的智能体补丁检索系统

    测试Qwen3-235B、Qwen3-Coder-30B、gpt-oss-120B 等 6 个
    摘要PatchHolmes 用混合检索和列表式四工具智能体做补丁检索,增益主要来自联合阅读候选而非更换骨干。

    PatchHolmes 是面向补丁检索的两阶段系统:在本地 Git 仓库上用冻结开源权重模型,为一个已知 CVE 找出修复提交,不做按仓库微调,也不使用付费外部搜索 API。

    完整解读
  6. 其他arXiv:2609.38143 ·

    为测试时 AI4AI 的智能体执行环境设计学习元技能

    Builder 从 Target 执行反馈中学习 meta-skills,再据此为未见任务搭建 harness。两模型权重固定。

    测试GPT-5.6-Sol、Gemini-3.6-Flash、Qwen3.8-Flash 等 5 个
    摘要冻结的 meta-skill 库指导 Builder 为未见任务搭建 harness,权重保持固定。

    作者研究 test-time AI4AI:Builder 与 Target 权重都固定时,Builder 学习如何为 Target 构造更好的执行环境。

    完整解读
  7. 其他arXiv:2609.15818 ·

    Atria Dawn Preview:智能体超级智能的黎明

    AI 导读研究团队发布面向科研与工程工作流的基础智能体语言模型 Atria Dawn Preview,通过可验证经验管线将工具交互连接到可执行环境与外部验证结果。

    测试Atria Dawn Preview、DeepSeek V4 Pro、KIMI K3 等 7 个
    摘要Atria Dawn 在五个基准上领先,研发日志里人类仍掌握大多数最终决定。

    Atria Dawn Preview 是面向研究与工程流程的智能体语言模型,论文同时报告它的基准表现,以及开发它的过程中人与智能体如何分工。

    完整解读
  8. 其他arXiv:2609.15779 ·

    EvoOntology:面向数据智能体的自演化本体层

    论文提出 EvoOntology:以 MCP 封装可自演化的本体层,供数据智能体按需查询异构数据语义。

    测试GPT-5.5、GPT-5.6-sol、Claude-Sonnet-5 等 6 个
    摘要EvoOntology 用可查询、可演化的 MCP 本体缩小数据智能体与异构数据的差距。

    EvoOntology 为数据智能体增加一层可在运行时查询、并随执行轨迹更新的本体,用来缩小 agent–data gap。

    完整解读
  9. 其他arXiv:2609.17247 ·

    DriveMCP:面向高级驾驶辅助系统的智能体 AI 框架

    DriveMCP 将 DriveLM 感知与 Rules、Weather、MCP-CAN 及 RSS/TTC 仲裁接成可审计辅助层。作者报告在 CARLA 三类场景中违章与超速低于三个 VLM 基线。

    测试DriveLM
    摘要DriveMCP 用可审计专家工具和 RSS/TTC 仲裁做驾驶辅助,作者称违章与超速低于三个 VLM 基线。

    DriveMCP 是面向高级驾驶辅助的模块化智能体框架,把感知、合规、车辆状态和安全仲裁拆开并留下审计轨迹。

    完整解读
  10. 其他arXiv:2609.18120 ·

    PentestChain:面向免费层 LLM 的成本感知 MCP 编排自动化渗透测试框架

    测试qwen2.5:7b (Ollama, local)、OpenRouter (free-tier)、Cerebras (free-tier)
    摘要确定性利用图加免费层级联在十次自建运行上测得付费成本为零。

    PentestChain 是一个十阶段、经 MCP 暴露的自动渗透框架,用确定性利用图把 7B 本地模型挡在利用关键路径之外,并把每次交战的美元成本当作实测指标。。

    完整解读
  11. 其他arXiv:2609.22961 ·

    当智能体信任跨越组织边界:结构外化与信任证据参考模型

    Li 与 Xia 提出 TaaS:用三条件诊断判定跨域依赖命题,并把不可变清单与追加式证明绑到有界委托动作。论文无实测数字,只给出 TaaS-Eval 协议提案。

    摘要TaaS 用三条件诊断和信任证据信封,为跨域有界委托动作规定可核验、可质疑、可恢复的证据语义。

    Li 与 Xia 给出一份概念性的智能体跨域信任控制画像,称为 Trustworthiness as a Service(TaaS)。问题是:依赖方要接受、拒绝、审计、定价或质疑一次跨越行政信任边界的委托动作时,不能把生产域的日志或签名断言当作自己的证明。撤销、中断、记录冲突或争议之后,状态与质疑语义仍须可解释。

    完整解读
  12. 综述/立场arXiv:2609.25413 ·

    论文提议前沿 AI 开发者开展嵌入式评估

    作者主张前沿实验室现在就开始托管嵌入式评估,至少覆盖内部智能体监控、权限控制与模型对齐,并持续评估、至少每季公开详细报告。

    摘要论文建议前沿开发者现在就以接近员工的现场访问,持续审查内部监控、权限与对齐。

    嵌入式评估是一种第三方评估:独立评估者在前沿 AI 开发者现场获得接近员工的系统、人员与文档访问,用来审查依赖内部系统与实践的风险。

    完整解读
已经到底了