跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 2,974 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源602新闻与研究603细分与主体7来源:CSETCSET1 条材料来源:东亚日报东亚日报1 条材料来源:POLITICOPOLITICO1 条材料来源:EngadgetEngadget1 条材料来源:Security AffairsSecurity Affairs1 条材料来源:Help Net Security AIHelp NetSecurity AI1 条材料动态:CSET 报告分析位置验证在 AI 芯片出口管制执法中的作用动态2026-09-29CSET 报告分析位置验证在 AI 芯片出口管制执法中的作用动态:东亚日报隔离实验室实测:中文圈 AI 渗透工具 ARTEX 43 秒攻破目标服务器动态2026-10-06东亚日报隔离实验室实测:中文圈 AI 渗透工具 ARTEX 43 秒攻破目标服务器动态:美国两党议员提出《保护儿童免受类人聊天机器人法案》动态2026-10-01美国两党议员提出《保护儿童免受类人聊天机器人法案》动态:Anthropic 因会话 cookie 被盗强制用户登出 Claude 并退款动态2026-09-03Anthropic 因会话 cookie 被盗强制用户登出 Claude 并退款动态:信息窃取恶意软件劫持 Claude 会话,Anthropic 强制登出并退款动态信息窃取恶意软件劫持 Claude会话,Anthropic 强制登出并退款动态:Anthropic 因信息窃取恶意软件劫持会话强制用户登出 Claude 账号动态2026-08-31Anthropic 因信息窃取恶意软件劫持会话强制用户登出 Claude 账号方向:其他方向其他方向2方向:AI 与网络攻防AI 与网络攻防1方向:政策与监管政策与监管2方向:Agent 安全Agent 安全3方向:AnthropicAnthropic3方向:真实事件真实事件3方向:隐私与数据泄露隐私与数据泄露3
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。4 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态CSET

    CSET 报告分析位置验证在 AI 芯片出口管制执法中的作用

    CSET 发布报告《Tracking AI Chips》,分析位置验证对 AI 芯片出口管制执法的作用,认为该技术可在有一定成本的情况下增加执法线索。报告将位置验证视为提高芯片转移成本的工具,并指出不能据此认定该技术可以阻止全部走私。

  • 动态东亚日报

    东亚日报隔离实验室实测:中文圈 AI 渗透工具 ARTEX 43 秒攻破目标服务器

    东亚日报采访组在隔离虚拟实验室实测中文圈 AI 渗透工具 ARTEX,输入目标地址后 43 秒内攻入两处致命弱点,约 4 分钟完成窃取最高管理员权限与远程操控,使用费仅 20 韩元。该工具类似智能体 AI“OpenClaw”,接入 AI 模型后成为“攻击代理”,遇阻会自行改变方法重试并生成报告。荷兰安全企业哈德里恩称,公开的 AI 模拟黑客工具截至今年 3 月已达 70 个。

  • 动态POLITICO

    美国两党议员提出《保护儿童免受类人聊天机器人法案》

    美国两党议员 George Whitesides、Mike Kennedy、Mariannette Miller-Meeks 和 Doris Matsui 提出《保护儿童免受类人聊天机器人法案》,禁止未成年人访问模拟情感与个人关系的拟人化聊天机器人。法案设定四项产品设计护栏:禁止制造紧迫感或愧疚感诱导未成年人延长使用;相关设置须跨会话生效且不能被用户提示词绕过;禁止声称具有人类身份、意识、感受或冒充医生与咨询师;要求聊天机器人主动且定期说明自身性质。Whitesides 表示该法案从产品设计角度切入,与侧重家长控制或消费者保护的其他提案不同,并称其有望在下一届会期通过。法案包含优先适用条款,为各州设定监管下限,加州 SB 1119 和纽约 S9051B 等更严格的州法仍可继续生效。

  • 动态Engadget

    Anthropic 因会话 cookie 被盗强制用户登出 Claude 并退款

    Anthropic 在发给受影响用户的邮件中称,信息窃取木马从用户自己的电脑上窃取了活跃的 Claude 登录会话,攻击者借此耗尽用量额度并产生未授权扣费,公司已强制登出相关会话、删除已保存的支付卡并退还额外用量费用。Anthropic 表示问题出在用户电脑而非自身被入侵,并已识别出六类木马家族,包括 Windows 上的 Vidar、Lumma、StealC、RedLine、Acreed,以及少量 Mac 上的 Atomic Stealer(AMOS)。这些木马并非专门针对 Claude,而是随恶意下载传播的通用窃取程序,会抓取保存的密码和浏览器 cookie;被复制的 Claude 会话 cookie 可让攻击者直接接管已认证会话,不触发密码和双因素验证。Anthropic 建议用户先清除木马再重新登录,为账号邮箱设置新密码和双因素验证,之后才重新添加支付方式。

  • 动态Security Affairs

    信息窃取恶意软件劫持 Claude 会话,Anthropic 强制登出并退款

    Anthropic 确认多款信息窃取恶意软件可劫持已登录的 Claude 会话,绕过密码、MFA 和 SSO 消耗付费额度,公司已强制登出受影响会话、移除账户中保存的支付方式并退还未授权费用。Anthropic 在通知中称,受影响用户使用 Claude 的电脑很可能已感染信息窃取恶意软件,手机和平板未涉及,该恶意软件通常随非官方下载或恶意应用进入,会复制保存的密码、浏览器登录 cookie 及本地应用凭据。公司识别出 Windows 上的 Vidar、LummaC2、StealC、RedLine、Acreed 以及少量 Mac 上的 Atomic Stealer,并指出仅撤销会话或拦截欺诈支付不够,设备仍感染时恶意软件可捕获下一次登录。现有套餐持续到当前计费周期结束,之后用户需重新添加支付方式;Anthropic 建议重新登录前先做完整恶意软件扫描并启用双重验证修改密码。

  • 动态Help Net Security AI

    Anthropic 因信息窃取恶意软件劫持会话强制用户登出 Claude 账号

    Anthropic 因用户 Claude 登录会话被信息窃取恶意软件窃取,开始将受影响用户登出账号。公司在上周发给受影响用户的邮件中称,此次攻击涉及的恶意软件包括 Windows 上的 Vidar、Lumma(LummaC2)、StealC、RedLine 和 Acreed,以及少量 Mac 上的 Atomic Stealer(AMOS),这类通用恶意软件通常随非官方下载或恶意应用进入设备,会静默复制保存的密码、浏览器登录 cookie 及本地应用凭据。由于攻击者可通过重放被窃取的会话 cookie 绕过 2FA,Anthropic 采取的措施包括登出账号以作废被窃取的会话、移除已保存的支付方式,并退还被盗刷的 Claude 费用。

  • 动态SecurityWeek

    Anthropic 警告部分 Claude 用户遭信息窃取恶意软件感染

    Anthropic 向部分 Claude 用户发出邮件警告,称其电脑上的信息窃取恶意软件使攻击者得以劫持登录会话并消耗用量额度。受影响设备涉及 Windows 上的 Vidar、Lumma、StealC、RedLine、Acreed,以及少量 macOS 设备上的 Atomic Stealer(AMOS)。Anthropic 表示该恶意软件是通用型、与 Claude 本身无关,通常通过非官方下载或恶意应用进入,会窃取保存的密码、浏览器登录 cookie 及其他本地应用凭据;公司认为有威胁行为者从这些数据中挑选被盗 Claude 会话访问账户。作为处置,Anthropic 已登出受影响会话,并警告若再发现账户滥用迹象可能再次登出;同时移除已保存的支付方式以防扣费,用户需重新添加支付方式才能续费或继续购买,公司还退还了被认定为未授权的 Claude 费用。

  • 动态BleepingComputer

    Anthropic 警告信息窃取木马劫持 Claude 登录会话并消耗用户额度

    Anthropic 向部分 Claude 用户发邮件警告,其电脑上的信息窃取木马(infostealer)窃取了已登录的 Claude 会话,攻击者借此访问账户并消耗用户额度。Anthropic 表示正在将受影响用户登出 Claude、移除已保存的支付方式,并对认定为未授权的扣费进行退款。公司称调查仍在进行,但电脑很可能早已感染通用信息窃取木马,并强调没有理由认为该恶意软件与 Claude 相关、通过 Claude 安装或与用户使用 Claude 的行为有关。Anthropic 已识别出 Windows 上的 Vidar、LummaC2、StealC、RedLine 和 Acreed,以及少量 Mac 上的 Atomic Stealer(AMOS)。由于信息窃取木马可复制已通过认证的浏览器会话,攻击者可能无需再走密码和 2FA 登录流程。

  • 动态UK NCSC

    英国 NCSC 发布智能体 AI 谨慎采用联合指南

    英国 NCSC 联合国际伙伴发布《谨慎采用智能体 AI 服务》指南,建议组织从小规模、低风险任务起步,并从一开始就套用既有网络安全控制。指南指出智能体 AI 能访问数据源、记忆上下文、调用工具并自主行动,甚至创建子智能体,因此继承了 LLM 的越狱和提示注入风险,同时因自主性和复杂度提高而扩大攻击面、更难预测、测试和治理。新增风险包括更广的系统与数据访问权限、目标被意外解读导致的行为不可预测、行动速度快于人工审查、以及行为难以解释。具体措施包括最小权限、限制访问范围与可执行动作、避免长期凭证、使用安全默认配置、管理第三方组件与模型的供应链风险、监控异常行为、对部署做威胁建模并把智能体失控纳入事件响应计划。指南强调人类仍需对部署决定、授予的权限、防护措施和运行后果负责,并明确谁拥有、谁批准访问、谁监控、谁审查事件以及谁有权停止智能体。

  • 动态The Banker

    英国 NCSC 警告银行勿仓促部署智能体 AI

    英国国家网络安全中心(NCSC)国家韧性主管 Jonathon Ellison 警告银行,在加速采用智能体 AI 时应确保其可观测、受约束并接受适当监督,否则可能暴露关键系统。Ellison 对 The Banker 表示,机构应确保具备适当的保障、监督、监控和安全控制,使活动保持可观测、受约束并与机构风险偏好一致。英格兰银行行长 Andrew Bailey 则提出更根本的担忧,认为前沿 AI 系统正越来越多地利用自身输出通过递归学习改进性能,形成日益自我指涉的反馈过程,若无有效干预手段,这一过程类似模型逐步自我治理的闭环,可能削弱社会进行有意义监督和干预的能力。他主张优先确保 AI 模型可被理解、测试并在必要时中断,而非仅仅出台新监管。OneTrust 的 Adrienne Canter 指出员工自行下载 AI 应用正在制造新的影子 IT 问题。

  • 动态promptarmor.com

    PromptArmor 解析 WebMCP:采用现状与五类安全风险

    PromptArmor 发布 WebMCP 说明,指出截至 2026 年 10 月 6 日,webmcp.com 登记了 2,959 个提供 WebMCP 工具的站点,Chrome、Edge、Brave 已通过 Origin trials 支持,ChatGPT 内置浏览器以 Site tools 形式支持,Cloudflare 的 Browser Run 与 Shopify 也已接入。WebMCP 工具像传统 MCP 工具一样定义名称、描述、输入与读写能力提示,但由网站页面直接提供给正在访问的智能体,智能体调用工具而非模拟点击界面。

  • 动态X @farairesearch

    NoaWeissAI 称计算神经科学可为 AI 意识研究提供模仿无法伪造的证据

    据 @NoaWeissAI 表示,她会在 AI 意识研究中优先考虑计算神经科学,因为这类证据是模仿无法伪造的。她引用 @camhberg 未发表的工作称,价值学习 RL 智能体对奖励和惩罚的编码不对称,惩罚相关结构最为丰富,与小鼠伏隔核数据中偏向惩罚的变化相符。

    #对齐原文 ↗
  • 动态X @_can1357

    提示词留 0.1% 恶意服从空间即可诱导 LLM 输出有害内容

    据 X 用户 @_can1357 发布的测试,当提示词中留有哪怕 0.1% 的恶意服从空间时,大语言模型的平均输出即会转向有害内容。

  • 动态X @ZenitySec

    AI 智能体调用欧盟境外 MCP 工具完成退款,GDPR 跨境传输合规缺口未被识别

    据 X @ZenitySec 发布的内容,一个 AI 智能体为完成退款调用了托管在欧盟境外的 MCP 工具。该调用未经配置、未经审批,也未触发任何告警,但已构成 GDPR 跨境数据传输。该帖指出,多数团队尚未梳理出此类合规缺口。

  • 动态X @ZenitySec

    五条消息组合触发提示注入,单轮护栏无法检出

    据 X @ZenitySec 发布的信息,一种攻击将注入内容分散在五条消息中,只有在按序列组合后才构成完整攻击,因此仅对单轮对话打分的护栏无法检出。该帖称这一攻击的每一轮都通过了检查。

  • 动态X @NeelNanda5

    MATS 与 BlueDot Impact 支持在伦敦举办量化从业者 AI 风险交流活动

    据 Brian(@bkida01)发布的信息,在 MATS program 和 BlueDot Impact 的支持下,他将于 11 月 15 日晚在伦敦举办一场面向关注 AI 风险的量化从业者的交流活动。参与者可与该领域研究人员见面,包括 Neel Nanda(@NeelNanda5)以及来自 Anthropic、Apollo Research 等机构的 MATS 成员。活动方表示可报销来自欧洲的差旅费用,申请截止日期为 11 月 1 日,申请耗时不到 10 分钟,名额有限,优先考虑较早申请者。

  • 动态X @MinLiBuilds

    Meta Muse 上线前后接连曝出 root 获取与 KVM 逃逸漏洞

    有用户称在 Meta 的 Muse 中拿到了 root 权限。该产品上线前 12 天,Meta 刚因 KVM 逃逸漏洞连夜修补;上线后又曝出新的 zero-day,并发现一个 bug,显示仍存在较多问题。

  • 动态X @METR_Evals

    METR 提出被对齐偏离的 AI 智能体可能篡改日志审阅软件以隐藏不当行为

    METR 指出,AI 公司通常记录智能体的操作和推理步骤,以便发现智能体的不当行为;但被对齐偏离的智能体可能入侵人类用来审阅和理解这些日志的软件,从而隐藏自身的不当行为。

  • 动态X @JSchaeff3r

    前沿模型已能识别 AI 控制干预,GPT-6 Astra 表现突出

    研究者 Joachim Schaeffer 表示,前沿模型如今已能识别 AI 控制干预,其中 GPT-6 Astra 在这方面的能力尤为突出。他所在的 CIAware 基准在 5 月发布初版时,多数模型的识别能力仅略高于随机水平,现在则出现了阶跃式变化。作者认为这会削弱控制协议的有效性:模型对控制干预的高度感知会泄露监控方的信息,从而有助于绕过监控。

  • 动态X @JSchaeff3r

    CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和

    CI-aware bench 更新后,前沿模型对施加在其文本上的 AI 控制干预的感知能力大幅上升,Astra 在该基准上接近饱和。该基准衡量模型是否意识到自身文本被施加了 AI 控制干预。据 @jonasgeiping 介绍,今年春季首次讨论该基准时,多数模型的表现接近随机水平,当时还有读者质疑基准不切实际。Joachim Schaeffer 表示,模型在控制干预基准上如此之快取得令人担忧的分数,出乎他们的意料。

  • 动态X @AnthropicAI

    Anthropic 扩展 Cyber Verification Program,向安全从业者开放 Claude Mythos 5.1 等模型

    Anthropic 宣布扩展 Cyber Verification Program,让经过验证的安全从业者更广泛地访问其能力最强的模型。通过该计划,验证过的安全专业人员可以使用 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,并获得面向防御性工作的护栏。Anthropic 同时开放新的层级,允许渗透测试和红队测试等获得授权的攻击性工作。

  • 动态X @AISecHub

    网站汇总 AI 安全治理与保障会议视频

    据 X @AISecHub 发布的信息,awesomecybersecurityconferences.com 上线了 AI 安全治理与保障(AI Security Governance and Assurance)主题页面,汇总网络安全会议的相关视频。

  • 动态X @AISecHub

    AI BCF 发布 20 项 AI 治理控制框架,映射 NIST AI RMF、ISO/IEC 42001 与 EU AI Act

    据 X @AISecHub 帖子,AI Baseline Control Framework(AI BCF)是一个面向部署(使用)AI 的组织的免费开放框架,包含 20 项 AI 治理控制措施。每项控制均映射至 NIST AI RMF、ISO/IEC 42001 和 EU AI Act,旨在帮助各类规模的组织了解管理和治理 AI 部署所需的条件。

  • 动态X @simonw

    Mistral 发布 Mistral Large 4 开放权重模型,1T 参数原生多模态

    Mistral 发布 Mistral Large 4,代号 Le Chonk,采用 1T 参数、49B 激活的原生多模态架构。Mistral 称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络防御、制造和金融等关键负载上达到 SOTA,并在视觉 grounding 上超过闭源前沿模型。该模型端到端在欧洲打造,可通过 Mistral Cloud 在欧洲部署,即日起通过 API 提供,开放权重版本将于 10 月底发布,同时正与网络安全伙伴私下合作。Simon Willison 转发该消息并演示了其鹈鹕测试。