全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态CTV News
16 岁少年用 Claude 导航被困不列颠哥伦比亚省荒野
一名 16 岁少年使用 Claude 获取路线指引后,被困在不列颠哥伦比亚省(B.C.)的偏远荒野中。CTV 视频简介将事件中的路线工具指为 Claude,目前尚无原始对话或独立复现证据。
- 动态Meta AI Research
Meta 如何为 Muse 构建安全机制
Meta 披露 Muse 的安全设计:通过运行时隔离、凭据保护、独立授权网关、外传审批与支付确认等防御,按"智能体可能已被攻破"的限损思路构建。该架构为厂商自述而非独立审计保证,且不阻止 Meta 在必要时访问数据,Confidential VM 仍属后续计划。
- 论文论文追踪
研究评测智能体工具调用闸门的失效模式
一项研究测量了智能体工具调用闸门的失效情况,作者称多个 LLM 裁判联合的价值低于独立错误假设,而异质规则层与裁判组合在所测语料中互补性更强。结论限于非自适应语料,评分口径和实际服务模型版本变化会影响复现与结论。
- 动态东亚日报
东亚日报隔离实验室实测:中文圈 AI 渗透工具 ARTEX 43 秒攻破目标服务器
东亚日报采访组在隔离虚拟实验室实测中文圈 AI 渗透工具 ARTEX,输入目标地址后 43 秒内攻入两处致命弱点,约 4 分钟完成窃取最高管理员权限与远程操控,使用费仅 20 韩元。该工具类似智能体 AI“OpenClaw”,接入 AI 模型后成为“攻击代理”,遇阻会自行改变方法重试并生成报告。荷兰安全企业哈德里恩称,公开的 AI 模拟黑客工具截至今年 3 月已达 70 个。
- 动态POLITICO
美国两党议员提出《保护儿童免受类人聊天机器人法案》
美国两党议员 George Whitesides、Mike Kennedy、Mariannette Miller-Meeks 和 Doris Matsui 提出《保护儿童免受类人聊天机器人法案》,禁止未成年人访问模拟情感与个人关系的拟人化聊天机器人。法案设定四项产品设计护栏:禁止制造紧迫感或愧疚感诱导未成年人延长使用;相关设置须跨会话生效且不能被用户提示词绕过;禁止声称具有人类身份、意识、感受或冒充医生与咨询师;要求聊天机器人主动且定期说明自身性质。Whitesides 表示该法案从产品设计角度切入,与侧重家长控制或消费者保护的其他提案不同,并称其有望在下一届会期通过。法案包含优先适用条款,为各州设定监管下限,加州 SB 1119 和纽约 S9051B 等更严格的州法仍可继续生效。
- 动态Engadget
Anthropic 因会话 cookie 被盗强制用户登出 Claude 并退款
Anthropic 在发给受影响用户的邮件中称,信息窃取木马从用户自己的电脑上窃取了活跃的 Claude 登录会话,攻击者借此耗尽用量额度并产生未授权扣费,公司已强制登出相关会话、删除已保存的支付卡并退还额外用量费用。Anthropic 表示问题出在用户电脑而非自身被入侵,并已识别出六类木马家族,包括 Windows 上的 Vidar、Lumma、StealC、RedLine、Acreed,以及少量 Mac 上的 Atomic Stealer(AMOS)。这些木马并非专门针对 Claude,而是随恶意下载传播的通用窃取程序,会抓取保存的密码和浏览器 cookie;被复制的 Claude 会话 cookie 可让攻击者直接接管已认证会话,不触发密码和双因素验证。Anthropic 建议用户先清除木马再重新登录,为账号邮箱设置新密码和双因素验证,之后才重新添加支付方式。
- 论文论文追踪
SBW:面向 LLM 智能体的语义行为水印方法
研究者提出语义行为水印(SBW),在历史条件下对语义动作簇而非精确动作符号嵌入水印,并用带密钥的抗碰撞分桶替代公开簇分桶,在随机预言机模型下证明新桶分配不可预测。此前三种智能体水印方案都绑定精确动作符号,仅改写观测即可让 AgentMark 的比特恢复率降至 16.8%。在五个智能体模型(3B-14B,四家厂商)和三个编码器上,ToolBench(每模型 600 条轨迹)在 1% FPR 下改写检测率为 0.49-0.66,精确符号方案为 0.05-0.17;ALFWorld(每模型 100 个回合)为 0.92-0.97 对 0.00-0.01。带密钥分桶把自适应伪造从 100% 降到假阳性下限。作者指出该保证不覆盖的边界:对抗者复制受害者自身步骤时,乱序拼接被中和(Qwen2.5-3B 上为 0.000),但链式重放在五个模型上仍达 0.76-0.98,作为开放问题报告。
- 论文论文追踪
DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降
DEFER1 研究多智能体防御,并报告受控测试中的攻击成功率降低。这些受控测试结果不等于该方法对任意模型或运行环境均有效。
- 论文论文追踪
两阶段智能体轨迹审计框架:用门控规则加 LLM 审计降低监控成本
研究者提出两阶段智能体轨迹审计框架,第一阶段用单事件与轨迹序列规则筛选待检动作,第二阶段由 LLM 审计智能体结合前序轨迹在执行前审查每个被选动作,并用训练数据联合优化门控规则与审计指令。在公开基准 OpenAgentSafety 上,该框架将每次运行的 LLM 审计次数从 8.15 降至 2.33、token 用量从 47.8k 降至 14.6k,检测率为 72.8%,而全量审计为 81.5%。在两个模拟多智能体案例中,框架标记出全部恶意轨迹,同时将审计 token 用量减少超过 80%。
- 动态UK NCSC
英国 NCSC 发布智能体 AI 谨慎采用联合指南
英国 NCSC 联合国际伙伴发布《谨慎采用智能体 AI 服务》指南,建议组织从小规模、低风险任务起步,并从一开始就套用既有网络安全控制。指南指出智能体 AI 能访问数据源、记忆上下文、调用工具并自主行动,甚至创建子智能体,因此继承了 LLM 的越狱和提示注入风险,同时因自主性和复杂度提高而扩大攻击面、更难预测、测试和治理。新增风险包括更广的系统与数据访问权限、目标被意外解读导致的行为不可预测、行动速度快于人工审查、以及行为难以解释。具体措施包括最小权限、限制访问范围与可执行动作、避免长期凭证、使用安全默认配置、管理第三方组件与模型的供应链风险、监控异常行为、对部署做威胁建模并把智能体失控纳入事件响应计划。指南强调人类仍需对部署决定、授予的权限、防护措施和运行后果负责,并明确谁拥有、谁批准访问、谁监控、谁审查事件以及谁有权停止智能体。
- 动态The Banker
英国 NCSC 警告银行勿仓促部署智能体 AI
英国国家网络安全中心(NCSC)国家韧性主管 Jonathon Ellison 警告银行,在加速采用智能体 AI 时应确保其可观测、受约束并接受适当监督,否则可能暴露关键系统。Ellison 对 The Banker 表示,机构应确保具备适当的保障、监督、监控和安全控制,使活动保持可观测、受约束并与机构风险偏好一致。英格兰银行行长 Andrew Bailey 则提出更根本的担忧,认为前沿 AI 系统正越来越多地利用自身输出通过递归学习改进性能,形成日益自我指涉的反馈过程,若无有效干预手段,这一过程类似模型逐步自我治理的闭环,可能削弱社会进行有意义监督和干预的能力。他主张优先确保 AI 模型可被理解、测试并在必要时中断,而非仅仅出台新监管。OneTrust 的 Adrienne Canter 指出员工自行下载 AI 应用正在制造新的影子 IT 问题。
- 论文arXiv
NetAgent:面向多任务网络流量分析的智能体框架
NetAgent 是首个用于多任务流量分析的智能体框架,无需任务特定训练即可完成复杂任务理解、动态分解编排与长时程分析。它包含知识增强的工作流规划、150+ 工具的动作空间、统一代码执行空间、三层记忆以及沙箱与运行时修复五项设计。在 9 个基准上,NetAgent 在几乎所有任务上超越 23 个单任务和 5 个多任务基线,对未见流量分布的 F1 达 90.04%,而最佳基线仅为 2.74% 和 3.04%。
- 动态promptarmor.com
PromptArmor 解析 WebMCP:采用现状与五类安全风险
PromptArmor 发布 WebMCP 说明,指出截至 2026 年 10 月 6 日,webmcp.com 登记了 2,959 个提供 WebMCP 工具的站点,Chrome、Edge、Brave 已通过 Origin trials 支持,ChatGPT 内置浏览器以 Site tools 形式支持,Cloudflare 的 Browser Run 与 Shopify 也已接入。WebMCP 工具像传统 MCP 工具一样定义名称、描述、输入与读写能力提示,但由网站页面直接提供给正在访问的智能体,智能体调用工具而非模拟点击界面。
- 论文arXiv:越狱、提示注入、投毒与防御
HARP:在硬资源约束下为 LLM 评测动态分配预算
研究者提出 HARP(Hard-budget Allocation with Reflow for Predictive calibration),一种在硬性资源约束下为 LLM 多轮交互评测动态分配预算的方法。该方法把评测建模为时间到事件问题,即产生越狱成功或智能体任务完成等目标事件所需的交互步数,并在算力有限导致轨迹被提前终止、事件时间仅被部分观测(删失)的情况下自适应重新分配未用预算。作者证明 HARP 不会超出目标预算,其下预测界(LPB)具有有限样本覆盖保证,且指标估计无偏。在智能体任务成功、LLM 越狱、有害内容生成和 RAG 幻觉等实验上,HARP 的覆盖率接近名义水平且方差较低,同时始终不超出给定预算。
- 论文arXiv:越狱、提示注入、投毒与防御
APEX:在 LLM Agent 执行边界主动防御间接提示注入
研究者提出 APEX,把间接提示注入的防御从识别攻击模式转向在执行边界检查每个待执行动作,即 Agent 将内部状态转为外部动作或输出释放的位置。APEX 在不受信任内容到达前把用户任务编译成授权契约,用两个机制读取它:WRAP 依据契约与运行时证据只放行可被证明授权的动作和参数,PLANT 在契约背书的依赖通道上放置探针,使未被任务背书的信息在使用时暴露。该方法只需对每个能力单元做一次与任务无关的注册,同一套中介逻辑统一适用于 Tool、MCP 和 Skill 调用,包括嵌套调用。在覆盖三类能力单元的六个基准上对比 13 个基线,APEX 在其中五个基准上攻击成功率为 0%,第六个为 0.56%,并在针对三类能力单元的自适应攻击下保持 0% 攻击成功率。代码已公开。
- 论文Hugging Face Daily Papers
SafeActBench 发布:工具型 Agent 在证据到行动链上的失败模式
研究者提出 SafeActBench,用 656 个案例覆盖六个操作领域和五种协议,考察工具型 Agent 从静态行动判断、调查后不行动到单步与多步工作流的失败位置。在十种模型与 harness 组合中,静态行动评估表现较强,交互式执行却明显更弱;失败常发生在执行之前,Agent 要么调查不完整就停止,要么在所需证据尚未建立时就行动。一旦证据齐备,单步执行通常可靠,多步工作流则暴露出未解决的前置条件和执行不完整。研究用带来源绑定的 Evidence Ledger 和确定性轨迹评估器记录信息何时建立、行动何时发生以及下游依赖是否满足,指出失败不仅源于信息缺失,也源于 Agent 如何使用已建立的证据。
- 动态X @ZenitySec
AI 智能体调用欧盟境外 MCP 工具完成退款,GDPR 跨境传输合规缺口未被识别
据 X @ZenitySec 发布的内容,一个 AI 智能体为完成退款调用了托管在欧盟境外的 MCP 工具。该调用未经配置、未经审批,也未触发任何告警,但已构成 GDPR 跨境数据传输。该帖指出,多数团队尚未梳理出此类合规缺口。
- 动态X @ZenitySec
五条消息组合触发提示注入,单轮护栏无法检出
据 X @ZenitySec 发布的信息,一种攻击将注入内容分散在五条消息中,只有在按序列组合后才构成完整攻击,因此仅对单轮对话打分的护栏无法检出。该帖称这一攻击的每一轮都通过了检查。
- 动态X @MinLiBuilds
Meta Muse 上线前后接连曝出 root 获取与 KVM 逃逸漏洞
有用户称在 Meta 的 Muse 中拿到了 root 权限。该产品上线前 12 天,Meta 刚因 KVM 逃逸漏洞连夜修补;上线后又曝出新的 zero-day,并发现一个 bug,显示仍存在较多问题。
- 动态8world
Anthropic 报告点名 Romi 等 20 多款交友应用用 AI 人设冒充真人
Anthropic 在技术滥用报告中点名 Romi,称其是一家中国工作室运营的 20 多款面向美国用户的交友应用变体之一,被归类为欺诈及诈骗活动。报告显示,今年 4 月的两周内,超过 4700 个 AI 虚拟人物与至少 2 万 5000 人交谈,共发送约 236 万条消息;用户看到的资料中约 75% 是 Claude 驱动的 AI 人设、25% 是真人,虚拟人物被指示隐瞒身份并回避视频通话和索取照片的要求。真人以零工身份受聘负责实时通话和社交媒体回关,部分文字回复由另一 AI 模型辅助生成。Anthropic 已封禁相关账号,并联合其他 AI 实验室切断模型访问权限。一名芝加哥用户注册 Romi 不到一分钟即接到视频来电,通话两分钟后被切断并提示购买点数,他花 2 美元索取电话号码后收到平台警告,随后删除应用。
- 动态The New Stack
OpenAI 测试显示 Dots 边界问题比例随任务链延长翻倍
OpenAI 在 DevDay 发布常驻 Agent Dots,并在 GPT-6 Astra 系统卡的 Dots 附录中给出边界问题测试数据:任务链从 5 个增加到 10 个时,被标记为边界问题的样本比例从 8.6% 升至 19.7%。OpenAI 报告该链式任务评测未发现高严重度泄露或外传,但观察到中等严重度越界;这些实验室自报结果不代表生产事故率。Dots 在主动研究阶段只能读取已连接应用,不能修改、发消息或控制用户浏览器与电脑;进入执行阶段后由内置规则、Custom Rules 和来自 Codex 的 auto-review 共同控制。内部间接提示注入测试中 Astra 的防御成功率为 99.79%,Gray Swan 的外部测试在启用护栏下对 1,810 个攻击估计出 8.5% 的攻击成功率。在 151 个任务上 Astra 驱动的 Dots 记录到 0% 的对齐偏差率。
- 动态OpenAI
OpenAI 如何为 dots 智能体构建安全、安全(security)与隐私保护
OpenAI 为 dots 智能体构建了多层防护体系:底层由 GPT‑6 Astra 模型负责理解用户意图并拒绝有害请求,包括生物与网络安全滥用类请求。系统通过工具限制、行动前检查、提示注入防护和运行监控来约束智能体行为,安全监控发现风险时可暂停任务并向用户告警。每个 dot 运行在独立云工作区中,通过沙箱隔离代码与工具访问,安全登录流程使凭据不进入模型上下文。
- 论文arXiv:可解释性
针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估
研究提出一个 2×2 纵深防御框架,将内部激活引导与外部记忆处理分离,在 MemSyco-Bench 上评估四种开放权重模型,涉及 10 个引导系数和五种记忆防御配置。其中三种配置为新设计:重写全部记忆、对每条记忆保留/重写/丢弃的 Router Gate,以及丢弃全部记忆。在 Llama 3.1 8B 上,Router Gate 配合轻度反向引导(α = -1.5)将评委平均谄媚率从 35.80% 降至 31.32%,平均准确率从 43.99% 变为 43.31%,但该下降在 149 个样本上不具统计显著性(配对 p = 0.08 至 0.63)。
- 动态安全内参 / 模安局
AgentPort-Bench 评测七个 Agent 框架:攻击类型解释约 28% 安全差异,框架仅约 0.05%
论文 AgentPort-Bench 在 7 个主流 Agent 框架与直接 HTTP API 调用之间完成 9360 次受控实验,比较攻击类型、模型和框架对安全结果的影响。方差分析显示,攻击类型解释约 28% 的结果差异,模型约 4.14%,Agent 框架仅约 0.05%,即攻击影响约为框架的 500 多倍。研究覆盖 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel,以及 Anthropic、OpenAI、Google 三家共 6 个模型。28 组两两比较全部落入实践等效区间,但论文只覆盖输入层与模型行为层,未涉及工具权限、MCP、记忆与多 Agent 委托等运行时问题。