跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 309 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源602新闻与研究603细分与主体7来源:arXivarXiv1 条材料来源:X @simonwX @simonw1 条材料来源:arXiv:可解释性arXiv:可解释性1 条材料来源:arXiv:危险能力与安全评测arXiv:危险能力与安全评测1 条材料来源:中国网信网中国网信网1 条材料来源:论文追踪论文追踪1 条材料论文:IAU-FOA:面向闭源多模态大模型的可迁移对抗攻击方法论文IAU-FOA:面向闭源多模态大模型的可迁移对抗攻击方法动态:Mistral 发布 Mistral Large 4 开放权重模型,1T 参数原生多模态动态2026-10-06Mistral 发布 Mistral Large 4 开放权重模型,1T 参数原生多模态论文:研究揭示 Transformer 拒答机制中的组件与维度稀疏性论文研究揭示 Transformer 拒答机制中的组件与维度稀疏性论文:研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器论文研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器动态:中央网信办部署为期4个月的清朗AI应用乱象专项整治动态2026-04-30中央网信办部署为期4个月的清朗AI应用乱象专项整治论文:PEV 攻击利用嵌入向量加噪越狱六款开源权重模型论文2026-10-05PEV 攻击利用嵌入向量加噪越狱六款开源权重模型方向:AI 动态AI 动态1方向:开源模型安全开源模型安全6方向:防御与护栏防御与护栏2方向:越狱与攻击越狱与攻击2方向:其他方向其他方向3方向:Agent 安全Agent 安全1方向:后门与投毒后门与投毒1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。5 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文arXiv

    IAU-FOA:面向闭源多模态大模型的可迁移对抗攻击方法

    研究者提出 IAU-FOA,一种面向闭源多模态大模型(MLLMs)的可迁移定向对抗攻击方法。现有定向迁移攻击主要用编码器 [CLS] 嵌入等全局图像级特征对齐对抗样本与目标样本,对 patch 级视觉结构利用不足,限制了跨异构闭源 MLLMs 的迁移性。IAU-FOA 同时在全局和局部对齐:用基于余弦的目标缩小全局语义差距,将 patch token 聚类为紧凑局部模式并通过最优传输匹配。针对均衡最优传输在缺乏可靠对应局部簇上强制固定边际质量、可能引入误导性对齐梯度的问题,作者引入置信度自适应非均衡传输,对弱匹配簇放宽约束。此外提出视觉不变性增强,通过双向像素强度缩放和逐通道白平衡调整模拟曝光、对比度、光照和色温变化。

  • 动态X @simonw

    Mistral 发布 Mistral Large 4 开放权重模型,1T 参数原生多模态

    Mistral 发布 Mistral Large 4,代号 Le Chonk,采用 1T 参数、49B 激活的原生多模态架构。Mistral 称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络防御、制造和金融等关键负载上达到 SOTA,并在视觉 grounding 上超过闭源前沿模型。该模型端到端在欧洲打造,可通过 Mistral Cloud 在欧洲部署,即日起通过 API 提供,开放权重版本将于 10 月底发布,同时正与网络安全伙伴私下合作。Simon Willison 转发该消息并演示了其鹈鹕测试。

  • 论文arXiv:可解释性

    研究揭示 Transformer 拒答机制中的组件与维度稀疏性

    研究将拒答激活引导分解为组件级干预,在四个开源权重模型上识别出足以复现完整行为效果的稀疏注意力与 MLP 组件子集。这些拒答方向集中在占上游组件 28% 至 48% 的稀疏机制中,仍保留 88% 至 101% 的引导效果;在这些机制内部,有效引导进一步集中在约 50% 的残差流维度上,保留组件机制基线的 85% 至 98%,与存在特权基结构的判断一致。作者据此认为拒答并非弥散编码于整个 Transformer,而是由结构化、可识别的机制组装而成,并将代码与原始实验结果开源在 https://github.com/wang-research-lab/Refusal_Mechanisms。

  • 论文arXiv:危险能力与安全评测

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。作者发现路由 logits 对多模态输入是否安全具有很高的预测性。在 Qwen3-VL 和 Kimi-VL 上,该检测器显著降低了 HoliSafe 基准上的安全错误,并泛化到安全模式不同的分布外基准 MISHard 和 MM-SafetyBench。作者认为,相比通过提示、监督微调或路由专家引导来干预模型行为与内部状态,直接读取自然涌现的信号并接入外部安全机制,可作为现有安全干预的简单、有效且非侵入式的补充。

  • 动态中国网信网

    中央网信办部署为期4个月的清朗AI应用乱象专项整治

    中央网信办印发通知,在全国范围内部署开展为期4个月的清朗·整治AI应用乱象专项行动,分两个阶段各整治7类突出问题。第一阶段为AI应用服务典型违规问题专项治理,重点包括未按规定履行大模型备案登记义务、平台安全和审核过滤能力不足、大模型训练语料安全、AI数据投毒、生成合成内容标识落实不到位、滥用AI技术实施网络攻击与换脸拟声、开源模型安全管理不到位。第二阶段聚焦AI信息内容乱象,涵盖利用AI魔改经典与生成数字泔水、制作发布虚假不实信息、假冒仿冒他人、暴力低俗内容、侵害未成年人权益、AI托管网络水军、AI产品服务和应用程序违规。通知要求各地网信部门履行属地管理责任,督导网站平台对照整治重点自查自纠,完善长效治理机制。

  • 论文论文追踪

    PEV 攻击利用嵌入向量加噪越狱六款开源权重模型

    研究针对开源模型输入表示受到扰动时的拒答失效风险,提出PEV方法并在受控基准中测试多个模型,报告产生不安全输出的结果。结论限于作者的实验设置。

  • 动态Google Bug Hunters

    Google 开源软件漏洞奖励计划规则更新:2026 年 10 月起停止接收产品漏洞

    Google 开源软件漏洞奖励计划(OSS VRP)自 2026 年 10 月 1 日起不再接收产品漏洞报告,涉及 Google Cloud 产品的漏洞可改投 Cloud VRP,计划将于 2027 年第一季度公布后续调整。该计划覆盖 Google 旗下 GitHub 组织公开仓库的最新版本及仓库配置,重点奖励可导致供应链入侵的漏洞,如修改主分支代码、构建发布基础设施配置缺陷、包管理器凭证或签名密钥泄露。第三方依赖漏洞需先在上游修复满 30 天并证明可在 Google OSS 中触发,第三方服务或平台自身的漏洞不在范围内。

  • 论文论文追踪

    研究评测 32 个 LLM 的代码功能与安全差距:新模型更安全但无一消除差距

    一项纵向研究用 CWEval 的 119 个任务、五种编程语言和 31 类 CWE,评测七个模型家族共 32 个 LLM 在旗舰与紧凑版本上连续三代发布的功能与安全差距。结果显示,新模型在绝对意义上确实更安全,但没有一个家族消除该差距;与既有研究不同,开放性并不区分家族,所有被考察的开源权重家族都显著缩小了差距,而 Gemini 3.1 Pro 的差距与 Llama 此前报告的同样宽。紧凑模型通常比旗舰版本生成更不安全的代码,Gemini 3.7 Flash 等是明显例外。在 CWE 层面,日志注入(CWE-117)和 HTTP 响应拆分(CWE-113)等弱点持续存在,最新闭源模型在内存与整数类弱点上出现回退,同一 CWE 在不同语言中的风险差异很大。作者据此建议开发者不要假定升级会提升安全性或闭源模型更安全,每次更换模型后应重跑安全检查,并在模型上下文中提供安全 API。

  • 论文论文追踪

    TRACE:仅凭 checkpoint 更新审计大语言模型有害目标

    研究者提出 TRACE,一种只读取 checkpoint 更新的权重审计方法,无需模型查询,也不需要接触未知的 SFT 数据。研究发现有害合规 SFT 会在 checkpoint 更新空间留下连续、依赖目标的排序:以纯有害合规、安全目标和良性效用三类 SFT 定义参考几何后,checkpoint 级坐标 s_H 能追踪受控的有害目标组成,在四个 7-8B 基座模型上 Spearman 相关系数为 0.986-0.992,更大模型规模上排序依然保持。对照实验显示该痕迹反映的是 SFT 目标而非有害输入暴露,也排除了有害样本数量或训练强度的简单解释。在分布偏移、未见数据、不同 SFT 配置、部分 checkpoint 访问以及 LoRA 与全参数微调下,该痕迹保持稳定,并与独立测得的攻击成功率正相关;在有害目标占比较低时仍有信息量。代码已公开。

  • 动态artificialanalysis.ai

    Mistral 发布 Mistral Large 4:法国重夺美中之外最强智能模型

    Mistral 以 Research Public Preview 形式发布 Mistral Large 4,在 Artificial Analysis Intelligence Index 上得分 38,与 GPT-6 Luna(max,38)相当,成为美中之外最智能的模型。该模型为 1T 参数(49B 激活),计划 10 月底开放权重;在 Cyber Index 上得分 50,与 GLM-5.3-Flash 持平,CyberGym-E2E-AA 得分 82%。标准定价 $1.36/$4.18 每 1M 输入/输出 token,前两周五折,上下文窗口 512k tokens,支持文本与图像输入。

  • 动态Anthropic Research

    Anthropic 披露 DeepSeek、Moonshot、MiniMax 的蒸馏攻击并说明防御措施

    Anthropic 在2026年2月23日发布的文章中,指称 DeepSeek、Moonshot 与 MiniMax 通过约2.4万个账号与 Claude 进行超过1600万次交互,以提取模型能力。其中公司报告 MiniMax 超过1300万次、Moonshot 超过340万次、DeepSeek 超过15万次。上述归因和统计来自 Anthropic,自身不证明此后有关敏感中国资料内容的其他指称。文章还介绍其检测、访问控制与行业协作措施。

  • 论文Hugging Face Daily Papers

    研究发现类型化决策模型主要按选项标签而非定义作答

    研究者对开放权重类型化决策模型及语言模型进行对照评测,发现部分模型会优先遵循选项标签的语义,而非定义中的规则。作者通过输入渲染的对照修改,将偏差与标签是否进入模型输入关联起来;所测 VON 在原设置下不受同样影响。研究未直接测试闭源商业 Jev 模型,合成评测结果不能直接代表所有部署场景。

  • 动态Princeton CITP

    研究者用 AI 编码 Agent 复原佐治亚州 150 万张选票的投出顺序

    普林斯顿 CITP 博士后研究员 Max Springer 用 AI 编码 Agent 结合公开记录,复原了佐治亚州 2026 年 5 月初选中 150 万张现场选票的投出顺序,占其考察县现场选票的 98.9%。他依据的是 2022 年 10 月披露的选票扫描机匿名化算法缺陷,该算法生成的随机编号实际可被逆向还原;在 139 个县中有 114 个县的现场投票顺序可被恢复。仅凭提前投票名单和 CVR 文件,约 1% 的提前现场选民可被唯一对应到具体选票;再加入投票站签到记录和审计日志后,Heard 县 650 名提前现场选民中的多数、Cherokee 县 Ball Ground 投票中心全部 1860 名提前选民均可对应到具体选票。作者称全程未接触投票机、未入侵网络、未查看源代码,也未访问非公开数据,Agent 未拒绝执行。

  • 论文论文追踪

    研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私

    研究者提出 Privacy-Leaking Watermarks(PLWs),一种由恶意模型提供方植入的隐形、触发依赖水印,可依据此前的聊天历史进行条件触发。在统一多模态架构下,对话中早先提到的敏感关键词或语义线索会让后续一张无关图像携带隐蔽但可检测的水印,从而把图像生成变成隐私泄露通道,即便模型在本地部署也无法避免。在 13 种敏感属性触发条件和两个模型家族上,PLWs 在 1% FPR 下最高达到 100.0% TPR;例如 OmniGen2 在所有测试的对话间隔下都能检出此前披露的抑郁信息,而对未披露此类信息的图像误报率仅 1%。

  • 动态Quartz

    韩国警方调查利用中国 AI 工具 Artex 攻击 7 家金融机构事件

    韩国国家警察厅就一起利用中国开发的 AI 工具 Artex 发起的网络攻击展开调查,至少 7 家韩国金融机构受影响,6.8 万人的个人数据被泄露。调查人员称攻击最早于上周被发现,带有 Artex AI 的特征,该工具由中国安全工程师李普华(化名 Autumn)开发并以开源软件形式发布,原本用于帮助机构发现自身网络漏洞。据 BleepingComputer 报道,金融服务委员会召开紧急会议,确认新韩银行发生数据泄露,涉及 2.5 万名客户,国民银行 11.9 万客户的信用卡数据被泄露,韩亚银行销售支持系统被入侵后也发生有限泄露。攻击源自约十几个国家的二十多个 IP 地址,包括美国、日本和德国,官方尚未确认攻击者身份,并表示正寻求国际合作。事件公开后,Artex 修改了使用条款,明确禁止将其用于未授权访问、数据窃取或其他恶意用途。

  • 论文论文追踪

    SWE-CC 基准:编码 Agent 功能正确仍违反 43.1% 仓库贡献规范

    研究者提出 SWE-CC 基准,用于评估自主编码 Agent 对开源仓库贡献规范的遵守情况。该基准通过半自动流程将 12 个开源仓库的开发者文档转换为 823 条可机检的原子策略,并为每条策略配备轻量确定性检查函数,同时审计 Agent 的运行时行为和最终交付物。团队在从 SWE-bench Verified 扩展出的 500 个端到端软件贡献任务上,用两种 Agent 框架评测了四个 LLM,结果显示 Agent 虽然能产出功能正确的补丁,仍违反 43.1% 的适用项目策略,且近一半违规发生在中间执行步骤。研究指出功能正确并不等于可实际合并,编码 Agent 需可靠遵循仓库治理规范才能安全部署。

  • 动态TechCrunch AI

    Mistral 发布 1T 参数多模态模型 Mistral Large 4,暂仅开放带护栏接口

    Mistral AI 发布 1 万亿参数多模态模型 Mistral Large 4(ML4),暂不开放权重,仅通过带护栏的公开接口访问,计划在安全测试完成后三周内开放权重。该模型完全基于 Mistral 自有算力训练,仅使用 4,000 块 Nvidia GPU,官方称比中国竞争对手少两到三倍。ML4 重点优化网络安全、金融和芯片设计等场景,基准测试结果尚未公布。

  • 动态The Decoder

    Mistral 发布万亿参数 Mistral Large 4,主打安全任务与欧洲主权

    Mistral 发布迄今最大模型 Mistral Large 4,总参数 1.05 万亿、激活 49 亿,采用细粒度 MoE 架构,上下文窗口 100 万 token,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。在 Artificial Analysis 综合十项基准的 Intelligence Index 上,ML4 得 38 分,较前代 Mistral Large 3 的 9 分大幅提升,但落后于 Claude Opus 5.5 的 58 分,也低于 Anthropic、OpenAI、Google 的头部闭源模型及部分中国开源模型。公司称 ML4 在 JailbreakBench、StrongREJECT 和 AgentHarm 的恶意网络提示上拒答率高于其他开源模型,并在 Lakera B3 基准中拦截 93.3% 的攻击。

  • 动态GitHub 安全公告

    Langflow 修复多个组件默认关闭的 SSRF 防护漏洞

    Langflow 安全公告指出,部分接收 URL 的内置组件曾缺少有效的服务端请求限制。具备创建或运行流程权限的已认证用户可能借此访问服务器可达的内部资源。相关组件的防护分阶段补齐,并在 Langflow 1.10.3 完成公告所列修复;不同底层软件包的修复版本需分别核对。

  • 动态CNBC · Technology

    Mistral 推出 Large 4 公开预览,称可与中国领先开放模型竞争

    Mistral 发布 1 万亿参数模型 Mistral Large 4(代号 le Chonk),称其综合基准性能将位居全球开源权重模型前列,且是"中国以外"最强开源权重模型,但在编程等领域仍落后前沿水平。该模型在 Mistral 欧洲自有数据中心用 4000 块 Nvidia Grace Blackwell GPU 训练两个月,面向开发者、网络安全负责人及国家机构开放预览,本月晚些时候更广泛发布。Mistral 称其网络防御能力可帮助企业抵御利用越狱闭源模型发起攻击的威胁行为者。

  • 动态WIRED Security and AI

    Mistral 发布万亿参数开源权重模型 Mistral Large 4(Le Chonk)

    Mistral 发布万亿参数开源权重模型 Mistral Large 4(昵称 Le Chonk),目前为预览版,正式版将于本月底推出。该模型针对编程、网络防御及制造、金融、电气工程等垂直领域优化,Mistral 称其是能力最强的非中国开源权重模型,且从零训练、未使用知识蒸馏。

  • 动态The Decoder

    韩国拟投 3.49 万亿韩元打造本土前沿 AI 模型

    韩国计划通过政府股权投资 4.7 万亿韩元(约 34.9 亿美元)开发本土前沿模型,资金列入 2027 年预算草案,尚需国会批准。另一条资金轨道用于推动韩国自研模型在本国经济中的采用。当前由 LG AI Research、SK Telecom 和 Upstage 参与的竞赛中,两家入围者不会自动获得额外资金,政府改为启动允许初创企业参加的公开竞赛。官员承认韩国无法与最大的美国公司竞争,但可以比肩中国的领先开源模型。该竞赛启动时政府曾向五家入选企业承诺 5300 亿韩元(约 3.9 亿美元),新计划约为其九倍。

  • 动态Mistral AI

    Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型

    Mistral AI 推出 Mistral Large 4(ML4)公开预览 API,权重将于本月底发布。该模型为 1 万亿参数原生多模态模型,激活参数 490 亿,在 Mistral 位于欧洲的自有数据中心用 3800 块 NVIDIA Grace Blackwell GPU 从零训练。在 Artificial Analysis Cyber Index 上,ML4 位列全球前五,其漏洞复现与修补测试得分 82%,为所有模型最高;Cybench 40 项挑战解决率 93%。Mistral 正与网络安全机构及政府主管部门在降低审核、扩展网络能力的条件下对模型进行红队测试。

  • 动态The Decoder

    Reflection 发布开放权重模型 Beam,称性能超越中国以外所有开源模型

    Reflection 发布首个开放权重模型 Beam,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿,主打低算力下的编码、逻辑推理与智能体任务。Reflection 称 Beam 在推理任务上以少 3 至 4 倍算力达到 GLM 5.2 水平,SWE-bench Verified 得分 80.9,但原始性能仍不及 Kimi K3。模型权重将以 Apache 2.0 协议于本月晚些时候发布,目前仍在进行最终安全测试。