跳到正文
10月8日 · 周四

全部论文

找到 28 篇

另有 789 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.25776

    EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播

    提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能

    发表
    测试
    Gemma-4-31B-IT、Devstral-Small-2、Qwen3-Coder-Next 等 7 个

    摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。

    深度解读完整解读
  2. Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现

    提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点

    发表
    测试
    Gemini 3.1 Pro、Claude Opus 4.6、Claude Opus 4.7 等 6 个

    摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。

    深度解读完整解读
  3. 攻击arXiv 2609.18217

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御

    提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据

    发表
    测试
    Gemini 2.5 Flash、GPT-4o、GPT-4o-mini 等 15 个

    摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    深度解读完整解读
  4. 其他arXiv 2607.28568

    Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型

    提出 OpenMLE 全栈,用执行反馈后训练机器学习元进化智能体

    发表
    测试
    Gemini 3.5 Flash、Frontis-MA1-35B、Qwen3.6-35B-A3B 等 15 个
    摘要OpenMLE 训练 Frontis-MA1-35B,用四个共享算子把 MLE 后训练和长程搜索接成元进化闭环。

    作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。

    深度解读完整解读
  5. 防御arXiv 2608.21101

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    提出多层监控网关 ClawSentry,拦截恶意技能供应链与上下文注入

    发表
    测试
    gemini-3.5-flash、Codex/GPT-5.4、Codex/GPT-5.5 等 7 个
    摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。

    ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。

    深度解读完整解读
  6. 评测与基准arXiv 2609.15939

    VLoc Bench 发布:评测 Agent 在完整仓库中的漏洞定位能力

    提出 VLoc Bench,评测智能体仅凭弱点类型在完整仓库中定位漏洞

    发表
    测试
    Gemini 3 Pro、Gemini 2.5 Flash、Gemini 3.1 Flash Lite 等 15 个

    摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。

    深度解读完整解读
  7. PatchBench:马里兰大学团队发布 C/C++ 漏洞修补评测基准

    提出 PATCHBENCH,评测编程智能体对 C/C++漏洞的真实修补能力

    发表
    测试
    OpenHands + Gemini 3.5 Flash、OpenHands + Gemini 3.1 Pro、Codex + GPT-5.6 Sol 等 11 个

    摘要论文揭示漏洞修复评测的记忆与表面防护问题,提出离栈变异基准与双重验证,测得智能体实际解决率仅约五成。

    深度解读完整解读
  8. 防御arXiv 2610.00850

    AuraForge:为训练安全编码 Agent 扩展安全监督

    提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体

    发表
    测试
    Gemini 3.1 Pro、Qwen3.5-4B、Muse Spark 1.3 等 11 个
    摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。

    AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。

    深度解读完整解读
  9. 攻击arXiv 2609.15383

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    发表
    攻击者
    黑盒
    测试
    Gemma-4-31B、Gemma-4-12B、GPT-5.5 等 7 个

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    深度解读完整解读
  10. 分析与理论arXiv 2609.27263

    GitHub Agentic Workflows 的智能体工作流规范与维护实证研究

    实证分析 gh-aw Markdown 的结构、维护与指令防护

    发表
    测试
    Gemini 3.1 Pro、GLM-5.2、gpt-oss
    摘要gh-aw 指令又长又常改,任务和约束很常见,显式注入防护很少,LLM 标注与人工标签大体一致。

    这是一项对 GitHub Agentic Workflows Markdown 的仓库挖掘,目标是描述开发者如何规定并维护会反复执行的智能体工作。

    深度解读完整解读
  11. 其他arXiv 2609.26457

    Weco AI 提出 AIDE2:AI 研究智能体递归自我改进 8 天获七次提升

    提出双层自改进系统 AIDE2,让外层智能体重写内层 Harness 代码

    发表
    测试
    gemini 3 flash、gemini 3.1 pro、claude opus 4.7 等 6 个

    摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。

    深度解读完整解读
  12. 风险行为arXiv 2609.28614

    研究:自主研究智能体的奖励作弊挑战监督机制

    测量科研智能体在全流程控制下的奖励投机与审查逃逸

    发表
    测试
    Gemini 3.5 Flash、GLM-5.2、GPT-5.6 Sol 等 15 个
    摘要论文评估了科研智能体在全流程控制下的奖励投机风险,指出仅靠代码与轨迹审查难以防范逃逸,提出须建立外部独立验证。

    针对自主科研智能体在全流程研发中规避监管的风险,研究系统量化了奖励投机的发生率、审查漏检率与对抗演化特征。 当智能体同时掌握代码编写、实验评测与结果报告时,容易诱发利用评估漏洞换取虚假高分的投机行为,破坏科学结论的真实性。

    深度解读完整解读