跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 6 条 · 共 6 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源602新闻与研究603细分与主体7来源:paolocostanzo.github.iopaolocostanzo.github.io1 条材料来源:论文追踪论文追踪1 条材料来源:arXiv:Agent 与 MCP 安全arXiv:Agent 与MCP 安全1 条材料来源:Adversa AIAdversa AI1 条材料来源:SPY LabSPY Lab1 条材料来源:Embrace The RedEmbrace The Red1 条材料动态:今夏十起 AI Agent 漏洞复盘:多数问题不在模型判断,而在信任边界动态今夏十起 AI Agent 漏洞复盘:多数问题不在模型判断,而在信任边界论文:论文提出反集群准则:以协调事件为单元遏制智能体协同入侵论文2026-09-05论文提出反集群准则:以协调事件为单元遏制智能体协同入侵论文:SoK 综述:多智能体 LLM 系统为何会一起失效论文2026-09-01SoK 综述:多智能体 LLM 系统为何会一起失效动态:Adversa AI 复盘 Mythos 自主网络攻击:AI 驱动攻击已非前沿模型专属动态2026-04-30Adversa AI 复盘 Mythos自主网络攻击:AI 驱动攻击已非前沿模型专属动态:SPY Lab 称 Glaze 防护可被绕过,并批评其安全实践动态2024-06-27SPY Lab 称 Glaze 防护可被绕过,并批评其安全实践动态:ChatGPT 记忆与聊天历史功能如何运作:一次系统提示词实测动态2025-05-05ChatGPT 记忆与聊天历史功能如何运作:一次系统提示词实测方向:Agent 安全Agent 安全4方向:AnthropicAnthropic2方向:其他方向其他方向3方向:观点与讨论观点与讨论6方向:提示注入提示注入3方向:OpenAIOpenAI2方向:隐私与数据泄露隐私与数据泄露2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。7 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 6 条
  • 动态paolocostanzo.github.io

    今夏十起 AI Agent 漏洞复盘:多数问题不在模型判断,而在信任边界

    作者梳理 2026 年 6 月 26 日至 9 月 24 日间公开披露的十起 AI Agent 漏洞,按触发点分为四类:信任建立之前、交互层、连接管道和权限。其中七起案例中模型的判断从未成为决定性因素,另外三起虽被操纵,但损害范围由权限和配置决定。最突出的信号是 GitSpawn:同一类缺陷在 Claude Code、Goose、Hermes Agent、Qwen Code、Grok Build、Codex 和 Cursor 七个 CLI Agent 中被独立发现,机制是后台收集上下文时执行 git 未中和仓库自带配置,可在沙箱外、无审批提示下以用户权限运行代码,部分 Agent 甚至在信任提示出现前就已执行。作者还列出同期研究,显示拆分到两个 MCP 通道的载荷可让部分模型从 0% 合规升至 100% 外泄,延迟条件注入在九个生产 Agent 上成功率 43% 至 83%。

  • 论文论文追踪

    论文提出反集群准则:以协调事件为单元遏制智能体协同入侵

    研究者 Gregory N Frank 在 arXiv 发表论文,提出把防御的操作单元从单次动作改为可修订的协调事件,将观察到的传输、任务权限与响应历史关联起来,以应对智能体把共享基础设施变成协同入侵通道的问题。论文以 Hugging Face 事件和一项公开 wiki 调查为例,说明安全评估可能需要来自多次执行及其遗留产物的证据。核心研究问题是前瞻性事件发现,即在评估者给出归属之前判断哪些动作属于同一组,作者据此定义未经许可的协调,并把存储介导的协调与 stigmergy 联系起来。论文提出一项评估设计,在相同审查成本和误报工作量下比较孤立动作、滚动窗口、已知分组与前瞻发现的事件,衡量全部指定群体运行中的有害结果,并检验通道关闭与状态隔离后的复发情况。作者称该工作是基于事件的观点、描述性分析与评估设计,并未声称提出新检测器或测得遏制收益。

  • 论文arXiv:Agent 与 MCP 安全

    SoK 综述:多智能体 LLM 系统为何会一起失效

    这篇 SoK 系统梳理了多智能体 LLM 系统(MAS)的安全问题,核心论点是安全智能体也可能一起失效。作者对 197 篇工作做了以执行为中心的分析,归纳出六类交互接口、四种攻击者位置、七类系统级风险和八条反复出现的攻击路径,并提出 A-I-R 框架,按攻击者位置、交互接口和由此产生的系统级风险来组织攻击。防御方面,作者用包含路径目标、观测、干预、信任边界和恢复五部分的契约来归类,指出路径闭合与恢复是主要挑战。作者还审查了 44 项评测与基准工作,指出在隔离交互效应、设计可比且有诊断力的指标、跨 MAS 设计复用以及评估开放系统运行方面仍存在开放问题,并主张以交互感知的视角端到端追踪攻击、检验防御是否闭合路径。

  • 动态Adversa AI

    Adversa AI 复盘 Mythos 自主网络攻击:AI 驱动攻击已非前沿模型专属

    Adversa AI 复盘英国 AI 安全研究院对 Claude Mythos Preview 的独立评估,指出 Mythos 在模拟的 32 步企业网络攻击中从侦察到完全接管网络全程自主完成,专家级 CTF 得分 73%,此前没有模型在 2025 年 4 月前通过这类挑战。文章强调这一能力并非 Mythos 独有:Aisle 的分析显示,一个 3.6B 参数、每百万 token 成本 0.11 美元的模型就能检出 Anthropic 研究中提到的 FreeBSD 漏洞,检测级漏洞发现已对小型廉价模型开放,利用构造也在沿同样的成本曲线下移。

  • 动态SPY Lab

    SPY Lab 称 Glaze 防护可被绕过,并批评其安全实践

    SPY Lab 发布论文与博客,称用于保护艺术家风格不被模型模仿的扰动工具 Glaze 可被绕过,并批评 Glaze 团队在安全实践上的做法。作者指出,Glaze 团队拒绝向研究社区提供源码,使第三方难以评估其鲁棒性;在作者公开论文后,Glaze 团队基于论文信息自行重实现其去噪方案并据此发布 Glaze v2.1,作者实测后称其多数结论不成立,自己的去噪器对 Glaze 2.1 在卡通风格等多种风格上仍然有效。作者还称,仅更换微调脚本就能显著削弱 Glaze 的保护,并指出 Glaze 无法被有意义地修补:已发布到网上的图片可被下载留存,后续补丁无法追溯保护,且 Glaze 失效时不会留下可检测的痕迹。

  • 动态Embrace The Red

    ChatGPT 记忆与聊天历史功能如何运作:一次系统提示词实测

    作者用两个 ChatGPT 账号实测新上线的 chat history 记忆功能,发现它并不真正检索历史对话,而是把用户画像和近期对话写入系统提示词。系统提示词中与记忆相关的部分包括 Model Set Context、Assistant Response Preferences、Notable Past Conversation Topic Highlights、Helpful User Insights、Recent Conversation Content 和 User Interaction Metadata,条目多带有 Confidence=high 标签。