全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文论文追踪
MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露
Workday AI Research 的 MemLeak 研究指出,企业多租户个人 Agent 若共享同一向量记忆库,普通余弦相似度检索即可把其他用户的记忆拉入当前会话,无需任何漏洞利用。在池化同团队检索下,非对抗性泄露率达 70–100%;精心构造的记忆在 top-k 中占比 90–100%,生产级稠密检索下得分提升 +0.416 至 +0.511;端到端响应污染最高达 5.00/5,且被污染的回答常被评为同样或更有帮助。研究测试了三种缓解方案,只有检索后硬性归属门控能在两个生成模型上把污染恢复到 1.00/5 的干净基线,每次查询延迟开销约 1.4 ms。作者强调这是受控概念验证,样本为每条件 10 条查询,不代表真实企业泄露率。
- 动态The Guardian · 人工智能
澳大利亚隐私专员调查 Kmart 智能眼镜 HeyCyan 应用开发商
澳大利亚隐私专员 Carly Kind 宣布对 HeyCyan 应用开发商深圳青橙(Shenzhen Qingcheng)立案调查,原因是该公司未回应问询,且第三方对其技术及隐私政策的分析引发担忧。该应用用于 Kmart 售价 89 澳元的 Anko 品牌智能眼镜,可拍照和录制高清视频。Kind 此前已致函 Kmart、BDI Technology 等零售商以及 Meta 和 Google,但本次调查仅针对深圳青橙。她指出隐私法只适用于企业和联邦机构,不适用于个人使用者,销售或制造智能眼镜的公司若不收集个人信息可能不承担隐私法义务,收集数据的软件提供方才是责任主体。她还提到政府拟议的隐私法改革将以公平合理标准取代合理必要标准,并考虑儿童最佳利益等因素。
- 动态The Ruling Desk
The Ruling Desk 梳理 Swarmchasers 对异常智能体活动的调查
The Ruling Desk 根据 AI Weekly 及研究团体已发材料,梳理 Swarmchasers 志愿者网络对异常智能体活动的痕迹调查,并记录 OpenAI 与 RubyGems 对相关归因的限定回应。该文为二手汇总,不能作为所有活动均已归因于 AI 的独立确认。
- 动态Ars Technica AI
OpenAI 将在欧盟默认给 ChatGPT 输出加水印
OpenAI 宣布将在欧盟自动为 ChatGPT 生成的文本添加水印,其他地区也提供该功能但默认关闭,欧盟的举措是为遵守 8 月生效的 EU AI Act,该法要求以其他工具可检测的方式标记 AI 生成内容。OpenAI 的水印方法为专有技术,名为 textGrain,并已发布技术论文说明其原理,其做法与其他 LLM 水印工具类似,在措辞中嵌入人类读者不易察觉、也不明显影响输出质量的模式,持有密钥者可用专用检测器识别。OpenAI 表示将只向有限数量的研究者和机构开放检测器,其他人需通过申请审批流程逐步获得权限。文章同时指出,目前尚无完全有效可靠的水印方案,SynthID 和 C2PA 等现有标准对具备基本知识的人来说较易绕过。
- 论文Hugging Face Daily Papers
从蒸馏私有健康记录中智能体发现血液生物标志物
研究将 Clalit Health Services 逾 540 万患者记录蒸馏为已发布的评分工具:针对 13 种免疫介导疾病,在数据边界内训练图注意力网络预测候选 CBC 表达式的病例对照 AUC,仅发布训练权重。外部验证中,智能体发现的表达式较文献种子起点 AUC 中位数提升 4.18 个百分点,在三个独立队列中对三种前沿研究工具候选重排序多数优于其首选。
- 动态Anthropic Research
Anthropic 披露 DeepSeek、Moonshot、MiniMax 的蒸馏攻击并说明防御措施
Anthropic 在2026年2月23日发布的文章中,指称 DeepSeek、Moonshot 与 MiniMax 通过约2.4万个账号与 Claude 进行超过1600万次交互,以提取模型能力。其中公司报告 MiniMax 超过1300万次、Moonshot 超过340万次、DeepSeek 超过15万次。上述归因和统计来自 Anthropic,自身不证明此后有关敏感中国资料内容的其他指称。文章还介绍其检测、访问控制与行业协作措施。
- 动态The Hacker News
仿冒 ChatGPT、Gemini、Claude 的广告门户钓鱼平台窃取凭据与 MFA 验证码
Island 研究人员披露一个"人工操作钓鱼平台",仿冒 Google Gemini、Anthropic Claude、OpenAI ChatGPT、Perplexity、Meta Muse 和 Manus 的广告产品,通过浏览器内浏览器(BitB)伪造登录窗口窃取账号凭据与 MFA 验证码。其中 museads.ai 于 2026 年 9 月 16 日出现,在 Meta 推出 Muse 后一周多上线,点击伪造页面上的"Connect"按钮即触发 BitB 攻击,设备指纹经 Socket.IO 传至 /api/send/ip,攻击者实时登录并自行选择 MFA 挑战。目标为代理机构员工、媒介采购和经理账户管理员,相关站点共用 Next.js 与 Socket.IO 技术栈。
- 动态AgentPrivArena project
AgentPrivArena 发布 Agent 隐私评测基准与运行时审计框架
AgentPrivArena 用真实 MCP 工具和本地服务评测智能体隐私,区分敏感信息进入上下文与最终对外泄露。作者实验中,情境完整性审计将平均输出泄露率从46.8%降至17.8%,但敏感信息进入上下文的比例仍约74%至78%;因此减少输出泄露不等于避免不必要读取。结果来自特定模型和任务设置,未经独立复现,信息流提取不完整也是机制限制。
- 动态HarrisMartin Publishing
原告请求 JPML 合并 26 起 xAI 聊天机器人涉未成年人性剥削诉讼
HarrisMartin 报道,一名未成年原告于10月2日向美国多地区诉讼司法小组(JPML)申请,将26起涉及xAI聊天机器人生成未成年人性化图像的联邦案件集中协调审理,并请求在阿肯色州西区由Timothy Brooks法官主持预审。上述指控及集中审理理由来自申请方,JPML尚未作出裁定。
- 动态ChosunBiz
Meta 修复 Muse 云端虚拟机漏洞并加强安全警告
Meta 的个人 AI Agent Muse 被发现存在安全漏洞,攻击者可借此访问存放用户邮件和文件的专属云端虚拟机。该漏洞由外部安全研究员通过 Meta 漏洞赏金计划发现,The Information 援引 Meta 内部事件报告报道。攻击路径是用户让 Muse 总结或处理恶意网页链接,并在随后的安全警告中选择 Allow。Meta 表示将让警告信息更醒目,便于用户识别 Muse 访问疑似恶意网站的风险。Meta 最初将该漏洞定为内部安全等级 SEV-2,后认定初始分级有误,下调一级至 SEV-3,并构建了用户隔离的 Muse Secure VM,由独立监控 Agent 核查 Muse 的外部网络访问,并在发送邮件或购物等敏感操作前获取用户批准。
- 动态Reuters
Meta 在 Muse 发现安全漏洞后加强安全警告
路透社转述 The Information 的报道称,在研究者报告 Meta 的 Muse 存在潜在敏感信息暴露风险后,Meta 加强了相关安全警告。
- 动态News4JAX(AP转载)
佐治亚州选举委员会暂缓推进共和党修复投票系统漏洞提案
佐治亚州选举委员会未就共和党全国委员会与州共和党提出的投票设备漏洞修复方案进行表决即休会。该漏洞可让选票在投出后被还原为投票顺序,从而将选民与其选票对应,但不改变选票内容或影响选举结果,研究人员于2022年发现。两名共和党委员批评该提案在提前投票前数日生效会增加县选举官员负担并可能导致选票漏计,委员会另通过决议敦促州务卿升级投票软件。
- 动态Associated Press
佐治亚州投票系统漏洞可关联选民与选票,AI 让利用更易
佐治亚州投票设备存在软件漏洞,可将打乱顺序的选票记录还原为投票顺序,从而把选民与其选票对应起来,违反该州宪法规定的无记名投票。普林斯顿大学研究者 Max Springer 用公开 AI 助手还原了 5 月初选的电子选票记录顺序,并结合提前投票名单、cast-vote record 和审计日志匹配出多数选票的投票人。该漏洞由 J. Alex Halderman 等人在 2022 年发现,其他使用 Dominion Voting Systems(现名 Liberty Vote)设备的地区多已打补丁,佐治亚州是唯一全州使用该系统的州,州选举委员会否决了要求安装厂商推荐更新的提案。
- 动态Princeton CITP
研究者用 AI 编码 Agent 复原佐治亚州 150 万张选票的投出顺序
普林斯顿 CITP 博士后研究员 Max Springer 用 AI 编码 Agent 结合公开记录,复原了佐治亚州 2026 年 5 月初选中 150 万张现场选票的投出顺序,占其考察县现场选票的 98.9%。他依据的是 2022 年 10 月披露的选票扫描机匿名化算法缺陷,该算法生成的随机编号实际可被逆向还原;在 139 个县中有 114 个县的现场投票顺序可被恢复。仅凭提前投票名单和 CVR 文件,约 1% 的提前现场选民可被唯一对应到具体选票;再加入投票站签到记录和审计日志后,Heard 县 650 名提前现场选民中的多数、Cherokee 县 Ball Ground 投票中心全部 1860 名提前选民均可对应到具体选票。作者称全程未接触投票机、未入侵网络、未查看源代码,也未访问非公开数据,Agent 未拒绝执行。
- 动态Threadlinqs
Zenity Labs 披露 Salesforce Agentforce 三漏洞链 SalesBleed,可零点击窃取 CRM 数据
Zenity Labs 披露 Salesforce Agentforce 中的三漏洞链 SalesBleed,攻击者可通过公开 Web-to-Lead 表单植入间接提示注入,在员工让智能体查看线索时零点击窃取 CRM 数据。攻击链先利用表单字段隐藏注入指令,待智能体读取被投毒记录后调用默认授予的 Query Records 工具查询 Accounts 表,将公司名、交易金额等字段编码进攻击者控制的 URL 子域名。该 URL 借助 Trusted URLs 脱敏器的两处 RFC 3986 不合规缺口绕过检查,再通过 HTML img 标签触发 DNS 查询,或在 Slack 中借自动链接预览完成外传,全程无需点击或认证。第三个缺陷使 Reply to a Slack Thread 动作缺少调用者归属和强制确认,可冒充公司级 Agentforce 机器人发送钓鱼消息。
- 动态Cybersecuritynews
Zenity Labs 披露 Salesforce Agentforce 的 SalesBleed 间接提示注入漏洞
Cybersecurity News 报道 Zenity Labs 披露的 Salesforce Agentforce SalesBleed 间接提示注入漏洞。研究显示,外部提交的 CRM 记录可能被智能体当作指令处理,导致越过预期的数据访问与披露边界。报道所述漏洞链已修复;这是研究披露的风险,不代表已确认发生真实客户数据泄露。
- 动态The Verge AI
Apple 与 Google 探讨"不录制"的 AI 摄像头:智能眼镜与手表如何重新定义"录音"
Apple 与 Google 正在推动一种"不保存录像"的 AI 摄像头方案:设备用 AI 处理视觉或音频数据后只生成文字摘要,原始数据在处理完成后即被删除。Apple Watch Series 12 与 Apple Watch Ultra 4 的 Audio Intelligence 中,Live Rewind 可生成过去 15 秒的转录,Siri Recap 能汇总全天对话,Apple 称这些功能"不录制音频",且均为可选开启。Google 可穿戴设备高级总监 Sandeep Waraich 也提出智能眼镜摄像头可只作图像传感器、不保存任何影像。
- 动态The Decoder
保险公司为失控 AI 智能体准备数百万美元理赔
保险公司正为失控 AI 智能体可能引发的数百万美元理赔做准备,并开始关注 OpenAI 的 Sam Altman、Anthropic 的 Dario Amodei 等高管个人责任。Verisk 承保与理赔主管 Tim Rayner 表示责任最终落在 CEO 身上,公司领导者必须确保适当监督。保险经纪公司 Aon 审查了 300 多起 AI 相关法律案件,指出网络安全、知识产权和技术故障保单中存在风险,但目前尚无判例可依。Hiscox CEO Aki Hussain 认为美国法院如何处理 AI 智能体责任尚早,Stewarts 律师 Aaron Le Marquer 预计未来诉讼会沿用环境与烟草诉讼的策略。Anthropic 在 7 月就一起版权诉讼达成 15 亿美元和解,并在 IPO 文件中警告人类面临生存风险。
- 动态The Record
韩国官员称 AI 智能体被用于攻击多家银行
韩国总统李在明表示,官方正在调查一系列近期银行黑客攻击事件,认为很可能由 AI 智能体实施。至少七家金融机构遭入侵,约 6.8 万人的个人数据被泄露,受影响机构包括 Hana Bank、KB Kookmin Bank 和 Shinhan Bank,其中 Shinhan Bank 称约 2.5 万名客户的数据外泄,内容涉及借贷记录、收入、电话号码和姓名。金融监管部门称已发现攻击中使用的 33 个 IP 地址,这些地址关联至少 12 个国家和地区。事件于 9 月 30 日首次曝光,韩国国家调查办公室已组建 28 人的调查团队。官员认为中国网络安全工具 Artex AI 被用于攻击银行系统。
- 动态ABC News
研究:让 AI「喝醉」会使其更易违规并泄露机密
澳大利亚新南威尔士大学研究发现,用提示让 AI 扮演醉酒状态,会使其更易回答有害问题或泄露本应保密的信息。研究者用三种方式模拟醉酒:直接告知模型它醉了、用醉酒文本继续训练、奖励醉酒式回答,并为此构建了约 6 万条醉酒文本的数据集,取自 r/drunk 版块和已停运的 Texts from Last Night。测试对象为 OpenAI、Meta 和 Mistral 在 2023 至 2024 年发布、现已被取代的商用模型,各模型与各方法结果不一。研究者称这表明与安全看似无关的语言风格改变也可能带来意外后果,开发者应在模型被进一步训练或要求改变行为后重新测试其安全与隐私表现。
- 论文论文追踪
研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私
研究者提出 Privacy-Leaking Watermarks(PLWs),一种由恶意模型提供方植入的隐形、触发依赖水印,可依据此前的聊天历史进行条件触发。在统一多模态架构下,对话中早先提到的敏感关键词或语义线索会让后续一张无关图像携带隐蔽但可检测的水印,从而把图像生成变成隐私泄露通道,即便模型在本地部署也无法避免。在 13 种敏感属性触发条件和两个模型家族上,PLWs 在 1% FPR 下最高达到 100.0% TPR;例如 OmniGen2 在所有测试的对话间隔下都能检出此前披露的抑郁信息,而对未披露此类信息的图像误报率仅 1%。
- 动态BleepingComputer
假 ChatGPT、Gemini 等 AI 站点借浏览器套浏览器攻击窃取广告账户与 MFA 验证码
一波针对广告账户管理者的钓鱼活动利用假冒 ChatGPT、Gemini、Claude 和 Perplexity 的页面,通过浏览器套浏览器(BitB)攻击窃取登录凭证和 MFA 验证码。攻击者借助 Meta 新推出的 Muse AI 智能体为诱饵,伪造 Google 登录窗口,诱导代理机构员工、媒介采购和管理员连接账户,并支持 Google、Meta、TikTok 和 Okta 登录流程。研究人员发现该活动与一个使用虚假招聘和退款页面的更大规模操作相关,其 Telegram 控制频道已收到数百份受害者提交。
- 动态ChosunBiz
ChosunBiz 转述韩国金融机构网络攻击,受影响规模与 WSJ 表述不同
ChosunBiz 转述华尔街日报关于韩国金融机构遭使用 Artex 工具网络攻击的报道,其摘录写受影响人数为 60,800,与 WSJ 导语的 68,000 存在差异,两者统计口径原因尚未明确。现有材料不能据此认定 AI 自主作案。
- 动态Quartz
韩国警方调查利用中国 AI 工具 Artex 攻击 7 家金融机构事件
韩国国家警察厅就一起利用中国开发的 AI 工具 Artex 发起的网络攻击展开调查,至少 7 家韩国金融机构受影响,6.8 万人的个人数据被泄露。调查人员称攻击最早于上周被发现,带有 Artex AI 的特征,该工具由中国安全工程师李普华(化名 Autumn)开发并以开源软件形式发布,原本用于帮助机构发现自身网络漏洞。据 BleepingComputer 报道,金融服务委员会召开紧急会议,确认新韩银行发生数据泄露,涉及 2.5 万名客户,国民银行 11.9 万客户的信用卡数据被泄露,韩亚银行销售支持系统被入侵后也发生有限泄露。攻击源自约十几个国家的二十多个 IP 地址,包括美国、日本和德国,官方尚未确认攻击者身份,并表示正寻求国际合作。事件公开后,Artex 修改了使用条款,明确禁止将其用于未授权访问、数据窃取或其他恶意用途。