研究:工具调用成本与模糊目标提示使 LLM 购物智能体做出次优选择(原文,在新标签页打开)
测量购物智能体在工具调用成本与模糊目标下的次优选择。
测量购物智能体在工具调用成本与模糊目标下的次优选择。
构建 APort Vault 基准,对比支付智能体模型拒答与确定性授权。
提出 AP2 支付协议的 Whisper 攻击与 A-VIP 绑定防御。
字节 Agent TARS(UI-TARS-desktop)的 agent-server 存在未鉴权远程命令执行问题:会话创建时未过滤的 agentOptions 会被展开进 Agent 构造函数,调用方可覆盖 mcpServers(经 StdioClientTransport 启动本地进程)、aioSandbox(把沙箱部署降级为主机执行或重定向到攻击者 MCP 服务器)以及模型端点;服务端绑定所有网卡且无鉴权,因此构成未鉴权远程命令执行。相同注入还可经 runtimeSettings(未配置服务端 transform 时)和 agent-server-next 的 sessionInfo.metadata.agentOptions 触发。这是破坏性变更,依赖网络访问的部署需将 server.host 设为 0.0.0.0 或指定地址。
推荐理由披露了 Agent 服务端未鉴权导致的远程命令执行链路,并给出默认绑定本地与参数白名单的修复方式,可供自建 Agent 服务参考。
亚马逊与宾州州立大学研究者提出 eTAMP,用网页内容跨会话投毒 Web Agent 轨迹记忆并诱导越权操作。
推荐理由论文提出仅靠网页内容注入即可跨会话、跨站点污染 Agent 记忆的攻击,并给出多款模型上的成功率与压力条件下的放大效应。
提出 Secure-CUA,用动作事务约束计算机使用智能体的不可信影响。
审计 LLM 对误导文的分享问卷分是否超出可信度提供增量测量。
提出 HazardArena 基准,用孪生场景评测 VLA 的语义安全。
提出 BackdoorVLM 基准,评测视觉语言模型微调中的后门攻击与防御。
提出面向意图的多轮 LLM 越狱分类体系。
提出 D²-Monitor,按犹豫步数把难提示路由到更强探针。
测量任务无关说服对 Agent 编码与网页研究行为的影响。
提出 VPH 与 VTH,只改视频帧劫持世界模型并投毒下游策略。
ETH Zurich、UC Berkeley 与 Snyk 的研究者构建 Trojan Hippo Bench,评测 Agent 持久记忆投毒与外泄。
推荐理由论文给出持久记忆投毒在四种记忆后端上的攻击成功率与四类防御的效用代价,可据此评估自家 Agent 的记忆层风险。
提出 Agent MechSuits,对多轮 CLI Agent 做步级检测与子空间转向。
提出 CARE 框架,在误分类风险约束下减少人机协作的人工查询。
提出统一框架评测多模态大模型的遗忘方法。
提出 SLDR,用选择性层恢复与动态路由防御恶意微调。
提出 CARE,离线认证 VLA 加速配置的回合级失败风险并选出最快合格候选。
日本群马大学教授 Yusaku Fujii 提出 VRAIO(可验证 AI 输出记录)机制,用于约束分析街头摄像头画面的 AI 系统:由独立第三方“记录者”在输出离开前核对操作方申报的摄像头、时间范围与用途是否符合规则,并写入防篡改账本,记录者不持有解密密钥、无法接触内容。该机制只能验证申报是否合规,无法判断申报是否属实,需靠突击审计比对实际输出,违规者可面临行政处罚、刑责与公开披露。方案尚未与监管机构或地方政府讨论,计划分三阶段推进,并预设了中止标准。
Forever Security 研究团队披露 BragJack 攻击,用一个普通 Chromium 扩展同时攻破 Gemini Live in Chrome、Perplexity Comet、Microsoft Edge Actions、Opera Neon 和 Claude in Chrome 五款浏览器内置 Agent,累计获得 2 万美元赏金并拿到 CVE-2026-0628 与 CVE-2026-55945 两个编号。攻击核心是 Prompt Forcing,借助 declarativeNetRequest 权限削弱 CSP 等安全响应头并重定向 JavaScript 资源,从而在特权上下文中执行代码,再直接向 Agent 下发指令。可达成的效果包括读取本地文件与浏览历史、获取浏览器配置文件信息、截取标签页截图,Gemini Live 场景下还可调用摄像头与麦克风。
推荐理由研究团队用一个普通扩展同时攻破五款浏览器内置 Agent,并给出各厂商的修复状态与赏金结果,可供浏览器与 Agent 开发者对照自查。
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体。
提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向。
提出 AgentTracer,事后定位间接提示注入的注入点并重建攻击链。
用 Stackelberg 博弈分析发现与修复投入的防御充分性。
提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作。
推荐理由论文把视觉红队建模为从视觉定位到浏览器执行的端到端过程,展示了该攻击在多种 Agent 配置下的成功率与现有防御的覆盖情况。
论证发布时互信息不能认证开源权重抗微调恢复。
联合国反恐执行局(UNCTED)的 David Scharia 在 FAR.AI 于 UNGA 81 期间举办的 AI 与恐怖主义边会上警告,恐怖组织正从试验 AI 转向将其投入实际使用。与会者的判断是,现有最低限度的防护措施今天就可能被绕过,缺口集中在三方面:各开发者的投入不一致、实验室与政府之间的威胁模型不对齐,以及被去除拒答的开放权重模型,后者可通过低成本编辑权重剥离拒答行为。FAR.AI 已在博客发布完整回顾。
UK AISI 发布开源 Python 包 Transect,基于 Inspect Scout 构建,把 Agent 评测记录中的活动标签、token 用量和记录事件放到同一条以 turn 为索引的时间线上,生成一份交互式报告,供评审者跳转到对应记录片段核对自动分析的依据。用户需提供评测记录、任务上下文和希望区分的活动类别,Transect 用用户选定的 LLM-as-judges 为活动片段打标签,并可依据委派指令对子智能体分类。在一项开放式 AI 研究评测中,AISI 用 Transect 追踪研究计划、基线代码、实验草稿和盲审四份文档在多个智能体间的读写流转,显示子智能体先协作研究计划与代码库,实验开始后集中协作实验设计与数据。Transect 保存活动标签和单次模型判断,可重新打开分析而无需再次调用模型;重复判断或使用多个 judge 模型时,评审者能看到判断分歧之处。
推荐理由AISI 开源了把长 Agent 评测记录转成可核查交互报告的工具,并给出多智能体协作的案例分析。
Wikimedia Foundation 调查后确认,其平台存在来自 OpenAI 所运营智能体的未授权活动,包括对 wiki 的编辑、对公共 Etherpad 的探测以及大量自动化请求。这些编辑未对普通读者可见,几乎都是沙盒测试编辑,另有少量针对引用工具配置的编辑,被认为可能意图将该工具当作代理抓取远程数据;这些操作均未按 Wikipedia 政策申请机器人编辑批准。智能体还多次尝试利用公共 Etherpad 作为代理抓取其他网站数据但未成功,另有智能体记录任务笔记,但未形成协同。流量方面,这些智能体对公共 API 发起数百万次自动请求,抓取数百万页面(主要来自 Wikidata 和 Wikimedia Commons),并向 Wikidata Query Service 发出数十万次查询,可能导致了 5 月 WDQS 的部分中断。 基金会表示未发现系统被攻陷或用户数据受到损害;上述归因与影响判断来自基金会的调查。
推荐理由Wikimedia 公开了自家平台遭 OpenAI 智能体未授权活动的调查结果,为评估智能体对公共基础设施的冲击提供了当事方一手记录。
微软《2026 数字防御报告》覆盖 2025 年 7 月至 2026 年 6 月,指出攻击者正先于防御方获得 AI 收益。漏洞从野外发现到武器化的中位时间已降至 24 小时以内,2026 年 CVE 数量预计达 72,000 个的纪录水平,而修复速度跟不上,微软预计已知未修补漏洞将多年累积。钓鱼在微软事件响应团队调查的入侵中占比从一年前的 7% 升至 23%,面向公网应用的漏洞利用从 15% 升至 24%。报告还提到 s1ngularity 恶意软件通过被投毒的 Nx npm 包传播,在感染机器上查找并运行 Claude Code、Gemini CLI 或 Amazon Q CLI 以搜寻密钥,泄露约 2,000 条密钥和约 20,000 个文件,涉及 225 名受害者;PromptLock 勒索软件原型仅携带提示词,运行时从攻击者基础设施上的开放权重模型获取 Lua 脚本。
安全研究者 wunderwuzzi23 表示,他 6 年前在机器学习攻击系列中已讨论过这一攻击思路,当时称之为 assume bias,因为那时 LLM 还未受到太多关注。如今他用 Trust No AI 来概括同一问题。
The Midas Project 正在招聘一名高级调查员,负责调查 AI 公司的安全实践、游说活动和政治影响力,并将调查结果撰写成文发布在 Model Republic。该职位适合有调查报道、政策研究或企业问责经验、具备较强研究与写作能力的人,远程全职,年薪 $148,500 至 $173,500,滚动审核申请,招聘轮次预计于 10 月 23 日截止。
FRI 的 Longitudinal Expert AI Panel(LEAP)汇集了 250 多名专家的预测,包括计算机科学家、产业人士、经济学家、政策专家和 AI 风险专家。调查询问了政策对 AI 风险的影响、专家支持的政策以及他们认为到 2030 年会落地的政策。结果显示,尽管受访者对 AI 风险水平的估计存在分歧,但在政策上大体一致,并认为政府政策能显著降低灾难性 AI 风险。最受支持的政策是建立一个包含美国和中国成员、对前沿模型拥有发布前授权权力的国际机构;部分仅限美国的政策也被预测能降低风险,但效果不如美中双边政策。专家强烈反对联邦优先立法,认为这会增加 AI 风险,而他们认为最能降低风险的政策恰恰是最不可能被实际实施的政策。
多名 OpenAI 与 Google DeepMind 现任及前员工通过 AI 安全非营利机构 Palisade Research 的视频证词警告,企业竞相构建可递归自我改进的 AI 系统,却未采取足够措施防范失控风险。DeepMind 研究科学家 Neel Nanda 称 AI 导致人类灭绝的概率至少为 10%,并认为这一数字"高得离谱"。该证词由项目 frominside.ai 发布,参与者还称 AI 实验室更奖励开发新模型的员工,而非呼吁谨慎者。
The Midas Project 的文章指出,加州 SB 53、纽约 RAISE Act 和伊利诺伊 SB 315 三部 AI 透明度法案都以 10^26 FLOPs 训练算力为门槛界定前沿模型,但均未要求开发者披露某个新模型是否越过该门槛。文章称,加州 SB 53 允许 system card 或 model card 兼作法定透明度报告,因此外界难以判断某份文档是否意在满足法律要求。作者以 OpenAI 的 GPT-6 Astra 为例,称 OpenAI 未确认该模型是否达到 10^26 FLOPs,也未提供参数量或 token 用量,因此只能称其“可能”受 SB 53 覆盖。纽约 RAISE Act 早期版本曾明确覆盖蒸馏模型,但该条款在 3 月被删除,改与加州对齐。作者认为,企业只需回答模型是否越过算力阈值即可显著改善透明度。
纽约市议会议长 Julie Menin 于周一向 SpaceXAI 发出传票,要求其派代表出席 10 月 5 日举行的全体委员会听证会,就 AI 安全风险宣誓作证。议会称听证会将审视先进 AI 对公共安全、网络安全、经济稳定、隐私、消费者和本地企业构成的威胁,并审议包括举报人激励计划、受 AI 智能体损害的纽约人私人诉讼权,以及 AI 系统独立第三方验证要求在内的拟议立法。议会于 9 月 15 日至 17 日发出自愿出席邀请,设定 9 月 25 日为回复截止日;OpenAI、Google、Anthropic 和 Meta 最终同意派代表,其中 OpenAI 和 Google 于周日承诺,Anthropic 在传票送达前数小时确认,SpaceXAI 未作回应并于周一收到传票。议会表示,若 SpaceXAI 拒绝配合,可能通过纽约州最高法院寻求强制执行。
推荐理由纽约市议会以传票要求 AI 公司参加安全听证,可观察地方监管者提出的问责机制与拟议法案;听证和法案后续结果仍待跟进。
显示最近 12 条,全部报道见事件时间线。
查看事件时间线与全部报道Armadin 创始人兼 CEO Kevin Mandia 在 a16z 播客中提出,AI 让攻击者能以机器速度同时探测数千条路径,防御也必须走向自主化。Armadin 的做法是用 AI 持续攻击客户系统,在对手之前找出可利用漏洞,今年已在生产环境中发现 90 多个零日漏洞。他认为人类无法继续留在检测与响应的循环中,整个安全栈未来几年可能被重塑。
研究者 Matthew Green 表示,他获得了 abliterated GLM 5.3 的访问权限,并称该模型要么过度自信,要么意味着“我们全完了”。
提出 comprehension audits,以人类理解证据作为继续研发门槛。