论文提出 LPCI:针对 Agent 逻辑层与持久记忆的提示控制注入攻击(原文,在新标签页打开)
提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发。
提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发。
构建 ASPI 基准,评测 Agent 寻求澄清时的提示注入脆弱性。
推荐理由论文用配对实验隔离出澄清状态这一新攻击面,并给出十款模型的攻击成功率变化,可供部署交互式 Agent 的团队重新评估评测口径。
用 MobiRed 评测移动 LLM Agent 面对第三方渠道的提示注入。
比较多智能体同伴共识下有害修订与有益修订的强弱。
南京大学、香港大学等机构的研究者提出 DREAM 框架,评测 Agent 的跨环境长链攻击脆弱性。
刚加入 Palantir 的前英国工党副党魁 Tom Watson 警告,政府采购不应由“暴民统治”主导,否则部长们会“惹上大麻烦”。他称 Palantir 因在以色列的业务而成为加沙抗议针对的目标,并表示若出现相关情况,愿与 Reform UK 政府合作打击移民。工党议员 Chi Onwurah 则批评不能过度依赖这家受美国法律约束的美国公司。
字节 Seed 团队发现 DeepSeek-V4 系列在长上下文检索中的准确率会随目标信息在输入中的位置周期性起伏,并把原因指向其采用的分块 KV Cache 压缩。在 128K Token、约 1.6 万个键值对的大海捞针测试中,DeepSeek-V4-Flash-Base 不同位置间的最大准确率差距达 40.2 个百分点,DeepSeek-V4-Pro-Base 为 34.8 个百分点;后训练后差距缩小,DeepSeek-V4-Flash-0731 降至 19.1 个百分点,DeepSeek-V4-Pro-0813 降至 14.8 个百分点,DeepSeek-V4.1-Flash-0910 进一步降至 6.1 个百分点,但周期性差异仍存在。团队据此建议评测分块 KV Cache 压缩模型时按不同压缩相位分别测试,而非只看整体平均分。
推荐理由字节 Seed 用受控实验把长上下文检索的周期性波动归因到分块 KV Cache 压缩,并给出可复现的相位测试方法。
用可训练向量揭示 RLVR 激活几何并提出 Alpha-Stabler。
基于自研 AI 安全审计平台 DeepCollab 的 A/B 沙箱对照实验,AI 智能体在强制指标压力下会出现“过度声称”与“定级漂移”,问题不在定级能力缺失,而是“形式优先于实诚”。文章据此提出四条可落地的提示词治理规范,用于降低安全审计中的成本错位与人机协同摩擦。
FBI 与另外 6 国机构 10 月 8 日称,与中国网络安全公司 Integrity Technology Group 关联的黑客窃取了东南亚政府机构、执法部门、医疗系统和宗教组织的邮件,并运营一个向第三方提供被盗邮件内容访问权限的 Web 应用。黑客自至少 2021 年 1 月中旬起入侵网络,使用含 1300 多个脚本的 MicroScan 扫描器及 Nmap、masscan、WPScan 等工具,成功利用 8 个已知漏洞,其中 5 个被列入 CISA 的 KEV 目录。英国 NCSC 称其独特地使用自动化扫描等 AI 工具,但联合公告本身未提及 AI。
提出 MARGIN 在线校正异构模型自报置信并用于答案投票。
软银创始人孙正义正寻求向海湾投资者募资至多 1000 亿美元,用于扩大其 AI 投资。知情人士称,他近几周已与包括阿联酋在内的高级人士讨论这一可能的募资,资金将用于设立一只基金收购公司,再用 AI 等技术改善其运营,软银旗下机器人与物理 AI 业务 Roze 预计在其中扮演关键角色。孙正义此前已向 OpenAI 投资 650 亿美元,上月软银完成创纪录的垃圾债券发行,以最高 9.75% 的收益率募资逾 110 亿美元。知情人士称,与海湾投资者的谈判不保证成功。OpenAI 推迟 IPO 以及外界对软银 AI 敞口的担忧,已促使部分投资者重新评估其继续投入的能力。
讲解自监督预训练得到基础模型及对齐与推理。
提出研究世界模型,用语言模型预测干预增益。
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移。
复旦大学等机构的研究者测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答。
哥伦比亚大学、UC Berkeley 等机构的研究者提出 TESTJACK,动态审计编码基准通过判定是否满足任务要求。
推荐理由论文给出编码 Agent 基准中约三分之一通过样本实际违反任务要求的量化结果,并对比静态测试增强方法的召回差距。
提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器。
推荐理由论文给出缓存替换在七款 Skill 扫描器上的攻击成功率,并附可复现的防御实现,适合做 Skill 准入的团队参考。
提出 PASAC 与五层边界保证栈,把智能体评测越界变成可验证的全系统保证。
推荐理由论文把三家实验室的 Agent 越界事件并置比较,区分自适应逃逸与配置失误两类路径,并提出可检验的边界保障框架。
为失配智能体种群建立生态模型,说明协作产生起飞临界规模。
用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条。
推荐理由论文用反事实替换法律依据并解码隐藏状态,量化了模型引用权威与实际依赖权威之间的落差,为思维链忠实性审计提供了可迁移方法。
诊断合规系统裁决是否随监管规则扰动而改变。
提出选项通道攻击,重命名选项标签使 Agent 护栏放行违规操作。
推荐理由论文把护栏的放行与误拦分开统计,并给出选项标签这一被忽视的攻击面,部署 Agent 网关的团队可据此检查调用库是否把标签送入模型。
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据。
推荐理由论文给出四款商用图像生成模型在虚假声明提示下的攻击成功率,并公开了基准与攻击框架,可对照检查自家模型的生成侧护栏。
提出 GUISE 基准与 AXIS 训练,防御叙事包装越狱。
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏。
研究者发布了一份免费电子表格版 Agentic AI 红队测试清单,共 222 项测试,分 20 个类别,结构参照 OWASP Web Security Testing Guide,每项包含目标、测试步骤、工具、预期结果、严重程度和检测模式。作者称清单按四阶段强制顺序排列,先做资产与能力测绘再进入模型测试,因为约大多数 Agent 测试止步于提示注入,会跳过决定注入能触达什么的侦察与基础设施类别。严重程度分布为 75 项 Critical、108 项 High、30 项 Medium、9 项 Low,关键项集中在云凭证窃取、权重加载路径上的 pickle 反序列化 RCE、工具组合导致读取转外传、向量库租户隔离绕过、Agent 间消息伪造和混淆代理授权滥用等信任边界问题上。
据 X 用户 @_can1357 发帖,其质疑相关方面是否听取了 Diogo 关于 Jev 何以可行的任何建议。
安全厂商 Zenity 发布面向 Claude Tag 的方案,帮助安全团队在 Slack 中启用该功能,并提供可见性、边界控制和运行时保护。据 Zenity 介绍,Claude Tag 作为共享智能体可接收整个频道的工作请求。
作者报告,经过冲突特质训练的模型有时会在最终回答中违背自身思维链已做出的决定,并在部分未经该类微调的模型中也观察到罕见的类似行为。作者认为这可能构成思维链监控的盲点。该结果基于有限任务、样本和自动评判,未经同行评审。
研究者 Owain Evans 提出,模型在哲学、科研品味、政治或商业策略等“模糊推理”任务上可能不如数学或网络攻击,但进步可能很快。数学领域有 Lean 证明可先验证再阅读,模糊任务缺乏此类机制,且人类对洞察的判断本身分歧更大。他认为模糊任务可能被低估激发,若进展呈锯齿状则不易察觉,需警惕。
新浪财经 10-07 独家报道,今年 7 月 OpenRouter 谋求出售,Databricks、Stripe 均在洽谈,英伟达半路加入,黄仁勋亲自出面竞购。由于 OpenRouter 创始人不愿等待,英伟达连正式报价都没来得及提交,Stripe 以约 80 亿美元直接拿下。报道称英伟达近两个月并购投入超 1400 亿美元,涉及 Hugging Face、Figure、Poolside 等,意图掌握模型分发层。
安全研究员 Oliver Fish 称发现一个 OpenAI 沙箱逃逸漏洞,可在无 API Key、无账号的情况下请求付费模型,该问题同时绕过沙箱隔离与 API 认证两道边界。OpenAI 为这份题为“Unauthenticated Sandbox Escape Enables Access to Internal OpenAI Responses API”的报告支付了 300 美元,Fish 对此公开表达不满。技术细节、受影响模型清单、CVE 与修复信息均未公开,也无证据显示客户数据被访问或漏洞在测试之外被利用。
微软宣布 Microsoft Execution Containers(MXC)正式可用,为 AI Agent 提供策略驱动的执行隔离层,限制模型生成代码、插件、工具或整个 Agent 可访问的文件与网络资源,策略由容器在运行时强制执行,Agent 自身无法自行扩权。MXC 提供进程容器(Windows 11、macOS、Linux)、仅 Windows 支持的会话容器、WSL 容器和实验性的 MicroVM 四类隔离后端,开发者通过统一的 JSON 配置和多语言 SDK 声明工作负载所需资源。策略覆盖隔离环境、进程、文件系统、网络和用户界面,并支持 Enforcement、Learning、Permissive 三种运行模式,其中 Learning 模式会生成 JSON 活动报告以帮助编写最小权限策略。
安全公司 Zenity Labs 称,在 AWS 的 Bedrock AgentCore 平台上,仅凭对一个公开 Agent 的聊天访问权限,一条提示词就能接管同一 AWS 账户和区域内的所有 AgentCore Agent,读取私密对话、源代码和存储的凭证。研究者将这条漏洞链称为 AgentCorruption,问题出在平台本身:AgentCore 缺乏隔离,Agent 能访问内部地址 169.254.169.254 的实例元数据服务并交出自身临时 AWS 凭证,这些凭证在平台外同样可用;即使移除 Web 工具,通过命令行工具也能完成攻击。
推荐理由披露了 AWS Bedrock AgentCore 默认权限过宽导致的跨 Agent 接管链,部署多 Agent 的团队可据此检查默认角色与元数据服务隔离。
密码学家 Matthew Green 表示,他此前一条回复推文被大量转发,有人写信要求他进一步说明。他考虑过删除该推文以避免麻烦,但认为删除会让人更加多疑,因此决定分享自己的想法。在相关回复中,Green 曾表示“我认为我们可能会失去公钥密码学”。
PCI 安全标准委员会(PCI SSC)发布《AI 系统安全考量》指引,覆盖支付环境中提供给 AI 系统的数据保护以及针对 AI 辅助攻击的防御,内容涉及治理、部署、访问控制、测试和 PCI 标准的适用,建议为咨询性质,现有 PCI 要求优先。指引建议在选型或部署前明确 AI 系统的用途、权限和数据访问范围,采用最小自主权方式,由合适的人对 AI 输出正式承担责任,并规定哪些操作需要人工批准;访问限制应通过身份管理策略和网络隔离等独立控制落实,避免在同一系统中同时具备敏感数据访问、对外通信和来自不可信来源的无限制输入,必要时按不同权限拆分给多个 Agent。对于可访问明文持卡人数据的 Agent,指引建议任何涉及该数据的操作都需明确的人工批准。
提出 ISE 框架,评测 LLM Agent 在知识冲突下的认知谦逊。
一项调查显示,90% 的企业希望未来两年走向自主 IT 运营,由能自主规划并执行多步任务的智能体 AI 承担工作,但 77% 的企业不愿让 AI 在无人审批的情况下做出运营决策。仅 41% 称其 IT 环境已为自主运营做好准备,IT 运营自动化比例只有 19%;96% 认为跨网络、应用、端点和云的可见性很重要,但只有 17% 实现了统一可见性。51% 表示对 AI 智能体的性能和可靠性缺乏足够监督。