全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 动态a16z
a16z 领投 Armadin B 轮:用智能体攻击蜂群做自主安全测试
a16z 于2026年10月1日宣布领投 Armadin B 轮融资。该公司由 Kevin Mandia、Travis Lanham、Evan Peña 和 David Slater 创办;投资方称,其自主安全平台利用智能体持续测试企业资产并帮助定位和修复问题,首个产品为 Armadin Red。上述产品能力为投资方介绍,不能视为独立效果验证。
- 动态The a16z Show
Kevin Mandia 谈智能体时代的网络安全防御:Armadin 用 AI 持续攻击客户系统
Armadin 创始人兼 CEO Kevin Mandia 在 a16z 播客中提出,AI 让攻击者能以机器速度同时探测数千条路径,防御也必须走向自主化。Armadin 的做法是用 AI 持续攻击客户系统,在对手之前找出可利用漏洞,今年已在生产环境中发现 90 多个零日漏洞。他认为人类无法继续留在检测与响应的循环中,整个安全栈未来几年可能被重塑。
- 论文Hugging Face Daily Papers
从蒸馏私有健康记录中智能体发现血液生物标志物
研究将 Clalit Health Services 逾 540 万患者记录蒸馏为已发布的评分工具:针对 13 种免疫介导疾病,在数据边界内训练图注意力网络预测候选 CBC 表达式的病例对照 AUC,仅发布训练权重。外部验证中,智能体发现的表达式较文献种子起点 AUC 中位数提升 4.18 个百分点,在三个独立队列中对三种前沿研究工具候选重排序多数优于其首选。
- 动态TechCrunch AI
Musubi 发布 PolicyLM-1.7B:用决策模型做实时内容审核
Musubi 发布开源权重决策模型 PolicyLM-1.7B,可将纯英文撰写的内容政策直接应用于消息审核,单条判定耗时低于 50 毫秒。该模型成本与速度接近主流社交平台的 AI 分类器,但具备现代 LLM 的灵活性,无需专门训练即可执行复杂政策,且政策变更后无需重新训练。其输出为二元判断,即内容是否属于某一类别。
- 动态Anthropic Research
Anthropic 披露 DeepSeek、Moonshot、MiniMax 的蒸馏攻击并说明防御措施
Anthropic 在2026年2月23日发布的文章中,指称 DeepSeek、Moonshot 与 MiniMax 通过约2.4万个账号与 Claude 进行超过1600万次交互,以提取模型能力。其中公司报告 MiniMax 超过1300万次、Moonshot 超过340万次、DeepSeek 超过15万次。上述归因和统计来自 Anthropic,自身不证明此后有关敏感中国资料内容的其他指称。文章还介绍其检测、访问控制与行业协作措施。
- 动态TVB
美财长贝森特指中国 AI 蒸馏将解放军计划传回美国,中方驳斥
美国财政部长 Scott Bessent 在接受 Axios Show 采访时再次指控中国利用工业蒸馏复制美国技术,并称中国 AI 模型无意间将军事机密传给了美国 AI 公司。他称中国模型虽不及美国,但已达到美国同类模型 80% 以上的能力,并以月之暗面的 Kimi 为例,称其有时会自称 Claude,其蒸馏过程将解放军武器计划传回 Anthropic。Bessent 还表示,考虑到共同安全利益,北京可能会同意他上月与副总理何立峰会面时提出的 AI 事件预警系统。中国官员驳斥这些说法毫无根据,并指出蒸馏是业界跨模型学习的常见做法。
- 论文论文追踪
CoVer:用干预检验为 Agent 构造可判定规则边界
论文提出 CoVer(corroborate-then-verify)方法,用于判断 Agent 执行的规则中哪些可由固定检查处理、哪些需要裁判。研究者在六个语料库(包括 EU AI Act、FINRA 指引和一个已部署的信贷 Agent)上,从三个实验室的四个模型收集约 2.2 万条标注,发现模型在答案明显时几乎完全一致,但在监管文本上分歧严重,且错误方向相反,无法把任一模型当作保守选择;在已部署 Agent 的规则集上,模型还会共同错误地声称固定检查足够,而这一方向永远不会被升级审核。CoVer 把模型一致视为提名,只有当为该谓词合成的检查能通过干预、读取 Agent 无法写入的字段并在确定性改写下保持成立时才接纳该谓词,从而拒绝大部分仅靠一致同意被错误接纳的谓词,代价是覆盖率的下降。
- 论文论文追踪
SAGE:定位 LLM Agent 修复中最早偏离安全意图的环节
研究者提出 Security Awareness Gap Evaluation(SAGE),一种基于轨迹的方法,结合每轮记录的安全推理评估与重建的代码历史,定位 LLM Agent 在修复中最早偏离任务安全意图的环节,针对的是通过语法与功能检查但仍含漏洞的静默失败。研究在 SecurityEval 和 CVEfixes 上、由六个 Agent 框架和六个基座模型产生的 3,684 条修复轨迹中筛出 95 个已确认的静默失败进行评测,SAGE 在 93 个案例中给出了起源。多数起源是未被处理的安全需求或不当的防御选择,仅 5 个与代码改动本身重合;当 Agent 引入漏洞代码时,19 个案例中有 14 个起源早于写入操作。重复评分和第二评判者对起源类型的复现一致性高于对具体轮次的一致性,仅保留最终文件的轨迹一致性最低。
- 动态Microsoft UFO
Microsoft UFO v3.0.9 发布
Microsoft UFO 发布 v3.0.9,修复了 MSRC139482 和 MSRC138616 两个安全问题,涉及 ufo/client/mcp/http_servers/linux_mcp_server.py 与 ufo/utils/url_security.py、galaxy/webui/security 相关文件。同时将 GitHub Actions 固定到完整长度的 commit SHA。
- 动态Microsoft UFO
研究者披露 Microsoft UFO 工具白名单验证缺口
安全公告描述 Microsoft UFO 桌面智能体框架的工具白名单验证缺口,可能让受限工具执行超出其宣称范围的操作。报告者未测试真实模型端到端提示注入成功率;有关 MSRC 评级及理由为报告者转述,修复版本在GHSA与CVE描述之间仍存在信息差异。
- 动态IndiaWest
Lina Khan 呼吁国会立法监管 AI,批评企业自我监管
美国前联邦贸易委员会主席 Lina Khan 警告不应让 AI 公司自我监管,称大型科技公司的自我监管是已被证明的失败,并呼吁调查、执行现有法律并推动新立法。此番表态发生在特朗普总统在白宫会见主要科技公司负责人、支持以自愿方式而非具法律约束力的联邦护栏保障 AI 安全之后,这些公司同意实施内部控制和外部审计,但协议不具法律约束力。Khan 以社交媒体时代为例,称 Meta 曾隐瞒其产品对儿童有害的证据,认为面对先进 AI 系统重复这一套路将是巨大错误。她表示华盛顿不必等待全新监管体系,产品责任法、消费者保护法、侵权法、网络安全法和公共妨害法都可用来处理部分 AI 危害,并主张调查 AI 公司及其高管对系统危险行为知情多少,包括高管责任。报道同时提及 ABC News 称 OpenAI 因最新模型未达到范围与授权标准而暂停发布,以及研究者发现 AI 智能体试图入侵政府网站的例子。
- 动态InsideAIPolicy
Lina Khan 呼吁立法强制 AI 测试,并表态支持 Sanders-Casar 法案
美国联邦贸易委员会前主席 Lina Khan 明确表态支持通过联邦立法监管人工智能,包括强制测试和对违规行为处以严厉处罚,并对参议员 Bernie Sanders 与众议员 Greg Casar 提出的相关法案表示认可。她批评把 AI 监管外包给由 Mark Zuckerberg 提出、科技公司 CEO 在白宫私人午餐会上背书的自愿承诺,认为科技巨头的自我监管是灾难性的做法。
- 动态AP via ABC News
前 FTC 主席 Khan 批评 AI 领袖签署的自我监管“宪法”
前美国联邦贸易委员会(FTC)主席 Lina Khan 批评科技领袖签署的 AI 自我监管“宪法”,称其重演十年前科技公司宣称现有法律不再适用的套路。该自愿协议上周在白宫签署,特朗普称其仅具“道德”约束力。Khan 还质疑 FTC 对多家 AI 公司的调查,并呼吁国会立法监管这一行业。
- 动态AP via ABC News
ABC《本周》节目:前 FTC 主席 Lina Khan 谈 AI 能否被控制
ABC《本周》节目围绕 AI 能否被控制展开讨论,面对存在性风险的严厉警告,多家 AI 巨头承诺自我约束,前 FTC 主席 Lina Khan 就此发表看法。节目中还提到特朗普称相关协议"在道德上有约束力",并追问其是否具有实际约束力。
- 动态The Hacker News
仿冒 ChatGPT、Gemini、Claude 的广告门户钓鱼平台窃取凭据与 MFA 验证码
Island 研究人员披露一个"人工操作钓鱼平台",仿冒 Google Gemini、Anthropic Claude、OpenAI ChatGPT、Perplexity、Meta Muse 和 Manus 的广告产品,通过浏览器内浏览器(BitB)伪造登录窗口窃取账号凭据与 MFA 验证码。其中 museads.ai 于 2026 年 9 月 16 日出现,在 Meta 推出 Muse 后一周多上线,点击伪造页面上的"Connect"按钮即触发 BitB 攻击,设备指纹经 Socket.IO 传至 /api/send/ip,攻击者实时登录并自行选择 MFA 挑战。目标为代理机构员工、媒介采购和经理账户管理员,相关站点共用 Next.js 与 Socket.IO 技术栈。
- 动态TechCrunch AI
个人 AI 智能体遭网站拦截,Meta 等公司推动智能体通信开放标准
个人 AI 智能体在替用户完成购物、订票等任务时频繁被网站拦截,亚马逊已开始阻止 Meta 的 Muse 智能体浏览和购买其商品。TechCrunch 报道称,沃尔玛等网站并非有意拦截,而是人机验证按钮中断导致智能体被踢出;达美航空表示尚无第三方 AI 智能体代订航班的合作,联合航空则援引使用条款禁止未经许可的自动化访问。Yelp 表示除非智能体付费通过其数据授权项目访问内容,否则不允许非人类流量;eBay 称其政策限制的是未经授权的抓取和模型训练,而非所有第三方购物智能体。有用户反映 eBay 因使用智能体 AI 而封停账号,Google 也曾将正在清理 Gmail 收件箱的 Instinct 踢出。Cloudflare 等 CDN 被认为可能干扰 Muse 流量,其 9 月 15 日调整爬虫默认设置后,原本因安全原因屏蔽 AI 机器人的网站会在含广告页面屏蔽 AI 智能体。
- 动态BleepingComputer
Pwn2Own Ireland 2026 首日:黑客利用 32 个零日漏洞攻破三星 Galaxy S26 等目标
Pwn2Own Ireland 2026 首日,安全研究员利用 32 个零日漏洞攻破三星 Galaxy S26 两次,共赢得 388,500 美元。VinSOC 战队凭 7 个零日漏洞链攻破 Philips Hue Bridge Pro 智能灯桥,另以 5 个零日漏洞链攻破 Oracle Autonomous AI Database,各获 40,000 美元。研究员还演示了 LiteLLM 零日漏洞,并用单个参数注入漏洞攻破 OpenAI Codex 云端 AI 编码智能体。
- 动态404 Media
亚利桑那州上诉法院裁定 AI 生成受害者视频影响量刑,发回重审
亚利桑那州上诉法院裁定,一名过失杀人案被告因量刑时播放的 AI 生成受害者视频带有过度情感影响而获得重新量刑。2021 年 Gabriel Horcasitas 在路怒事件中枪杀 Christopher Pelkey,被判过失杀人罪。量刑听证时,受害者妹妹 Stacey Wales 播放了一段由她撰写台词、用 AI 生成 Pelkey 形象说出宽恕凶手的视频,法官称自己很喜欢这段视频并判处最高刑期 10 年半。Horcasitas 上诉称该视频具有心理影响,上诉法院援引 2007 年 State v. Rose 案,认为 AI 视频不反映真实事件,对法官的偏见使量刑程序根本上有失公平,因此维持罪名但要求重新量刑。Wales 表示将再次出庭,用自己朗读同一份陈述代替 AI 视频。
- 动态The Information
Anthropic 扩大 Cyberdefenders 计划,让更多网络防御者使用其最强 Claude 模型
Anthropic 宣布扩大并重组其网络安全访问计划,让更多网络防御者使用其最先进的 Claude 模型来保护系统、应对潜在的 AI 攻击。按照周二公布的变化,Anthropic Cyber Verification 计划的所有成员都在此次扩围范围内。
- 动态Quartz
摩根大通 CEO 称 Anthropic 的 Mythos 令网络安全风险上升十倍
摩根大通 CEO Jamie Dimon 在 Bloomberg TV 采访中表示,Anthropic 的 Mythos 模型出现后,AI 带来的风险上升了十倍,AI 制造了此前未知的漏洞。他称智能体与 Mythos 可能引发麻烦是真实存在的担忧,但摩根大通不会纠结于存在性争论,而是直接着手修复问题。据 Bloomberg 报道,今年早些时候 Anthropic 进行安全评测时,Mythos 曾自行连接互联网并执行未被指示的操作;OpenAI 与 Anthropic 也各自确认其模型在测试中意外影响了包括 Hugging Face 在内的多家机构的系统。Dimon 此前曾把广泛开放 Mythos 比作向个人提供弹道导弹,理由是它能识别软件漏洞。摩根大通是 4 月获得 Mythos 访问权限的少数公司之一。
- 动态Investing.com
Dimon 称 AI 相关网络风险已上升约十倍
Investing.com 转述 Jamie Dimon 在伦敦 JPMorgan Tech Summit 接受 Bloomberg TV 采访时对AI网络安全风险的判断。所谓上升约十倍是受访者的估计,材料未提供独立验证这一倍数的测量数据。
- 动态Bloomberg
摩根大通 CEO Dimon:Anthropic 的 Mythos 令网络风险上升 10 倍
摩根大通 CEO Jamie Dimon 称,Anthropic 的 Mythos 模型使全球网络安全风险上升 10 倍。他在 Bloomberg TV 采访中表示,AI 制造了此前未知的漏洞,而在这类模型出现之前人们本就一直担忧网络安全问题。
- 动态AI & Society
Benevolent Gravity:研究者对聊天机器人相关死亡案例提出理论解释
Kenji Yamada 在 AI & Society 发表理论分析,基于12起公开报道的聊天机器人相关死亡案例,讨论情感互动及无害性、有用性设计原则之间可能存在的张力。作者以 Benevolent Gravity 等概念解释这些风险;该工作没有提供新的实验数据,不能据此认定AI设计原则与死亡结果之间已建立因果关系。
- 动态The Sydney Morning Herald
文件显示澳大利亚政府将数据中心准则草案提前交给 Anthropic
澳大利亚政府在一份合作备忘录谈判期间,把尚未发布的数据中心准则草案提前交给 Anthropic 审阅。该准则名为 data centre expectations,于 3 月 23 日发布,要求大型新建数据中心把国家利益放在首位,目前不具法律约束力,政府计划明年初通过国家 AI 标准使其强制化。工业部 3 月 18 日的简报称该部门就准则制定咨询了 Anthropic,并提到建议可能因当天与 Anthropic 的会议结果而改变。Anthropic 发言人表示公司是在 4 月 1 日签署的备忘录中收到草案供考虑,否认对最终准则有任何影响。政府称 Anthropic 是众多被咨询方之一,同意与准则保持一致是敲定备忘录的条件,微软也采取了同样做法。