跳到正文

#观点/讨论

今天还没有收录新动态
9月1日周二
  1. arXiv:Agent 与 MCP 安全 ·

    SoK 综述:多智能体 LLM 系统为何会一起失效

    这篇 SoK 系统梳理了多智能体 LLM 系统(MAS)的安全问题,核心论点是安全智能体也可能一起失效。作者对 197 篇工作做了以执行为中心的分析,归纳出六类交互接口、四种攻击者位置、七类系统级风险和八条反复出现的攻击路径,并提出 A-I-R 框架,按攻击者位置、交互接口和由此产生的系统级风险来组织攻击。防御方面,作者用包含路径目标、观测、干预、信任边界和恢复五部分的契约来归类,指出路径闭合与恢复是主要挑战。作者还审查了 44 项评测与基准工作,指出在隔离交互效应、设计可比且有诊断力的指标、跨 MAS 设计复用以及评估开放系统运行方面仍存在开放问题,并主张以交互感知的视角端到端追踪攻击、检验防御是否闭合路径。

4月30日周四
  1. Adversa AI ·

    Adversa AI 复盘 Mythos 自主网络攻击:AI 驱动攻击已非前沿模型专属

    Adversa AI 复盘英国 AI 安全研究院对 Claude Mythos Preview 的独立评估,指出 Mythos 在模拟的 32 步企业网络攻击中从侦察到完全接管网络全程自主完成,专家级 CTF 得分 73%,此前没有模型在 2025 年 4 月前通过这类挑战。文章强调这一能力并非 Mythos 独有:Aisle 的分析显示,一个 3.6B 参数、每百万 token 成本 0.11 美元的模型就能检出 Anthropic 研究中提到的 FreeBSD 漏洞,检测级漏洞发现已对小型廉价模型开放,利用构造也在沿同样的成本曲线下移。

5月5日周一
  1. Embrace The Red ·

    ChatGPT 记忆与聊天历史功能如何运作:一次系统提示词实测

    作者用两个 ChatGPT 账号实测新上线的 chat history 记忆功能,发现它并不真正检索历史对话,而是把用户画像和近期对话写入系统提示词。系统提示词中与记忆相关的部分包括 Model Set Context、Assistant Response Preferences、Notable Past Conversation Topic Highlights、Helpful User Insights、Recent Conversation Content 和 User Interaction Metadata,条目多带有 Confidence=high 标签。

6月27日周四
  1. SPY Lab Blog ·

    SPY Lab 称 Glaze 防护可被绕过,并批评其安全实践

    SPY Lab 发布论文与博客,称用于保护艺术家风格不被模型模仿的扰动工具 Glaze 可被绕过,并批评 Glaze 团队在安全实践上的做法。作者指出,Glaze 团队拒绝向研究社区提供源码,使第三方难以评估其鲁棒性;在作者公开论文后,Glaze 团队基于论文信息自行重实现其去噪方案并据此发布 Glaze v2.1,作者实测后称其多数结论不成立,自己的去噪器对 Glaze 2.1 在卡通风格等多种风格上仍然有效。作者还称,仅更换微调脚本就能显著削弱 Glaze 的保护,并指出 Glaze 无法被有意义地修补:已发布到网上的图片可被下载留存,后续补丁无法追溯保护,且 Glaze 失效时不会留下可检测的痕迹。

已经到底了