跳到正文
今天10月8日周四
  1. GitHub 安全公告 · 收录 · 原文 59

    Langflow 修复 MCP 资源处理器跨项目文件读取漏洞

    Langflow 的项目级 MCP 传输在连接时验证 project_id,但后续 resources/read 不校验所请求资源的归属,认证用户可借自己项目的 MCP 端点传入他人 flow 文件 URI,读取其他用户的文件。该问题最早出现于 v1.6.8,影响范围经维护者更正为 >= 1.6.8, <= 1.9.0,v1.9.1 通过 PR #12818 修复。修复后 handle_read_resource() 要求用户上下文并将 URI 命名空间解析为属于当前用户的 Flow 记录,项目级服务器额外校验 folder_id;同时拒绝含 ..、/、\ 的文件名,并关闭全局 MCP 服务器上的跨用户枚举。回归测试 test_handle_read_resource_denies_other_users_flow 复现了该跨用户场景并确认现已拒绝访问。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由报告给出了完整的受影响版本区间、修复版本与回归测试用例,可帮助使用 Langflow MCP 的团队核对自身版本是否已修补。

  2. GitHub 安全公告 · 收录 · 原文 51

    PraisonAI 提示注入防御默认阈值过高,单向量攻击可绕过拦截

    PraisonAI 的 InjectionDefense 提示注入防御层默认配置存在缺陷,block_threshold 默认为 ThreatLevel.CRITICAL,只有同时触发 3 项及以上检测才会拦截。单个检测命中,包括被明确标记为危险的指令覆盖和财务操纵类别,只产生 HIGH 级别告警并写入日志,不会阻断,请求原样转发给 LLM。研究者给出的验证提示词仅触发一项指令覆盖检测即可完全绕过防御,财务操纵类提示同样被放行。影响包括系统提示词提取、未授权工具调用、会话上下文外泄以及代理具备支付工具时的资金操纵。建议将默认阈值改为 ThreatLevel.HIGH,使任一危险类别命中即拦截,需要宽松行为的运营者可显式传入 CRITICAL,并更新阈值注释说明严重级别与拦截的映射关系。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由披露了 PraisonAI 提示注入防御因默认阈值过高而形同虚设,并给出单行修复方案,部署该库的团队可据此自查。

  3. The Hacker News · 收录 · 原文 ↑369

    LMCache 曝未修补严重漏洞 CVE-2026-105192,未认证攻击者可远程执行代码

    JFrog 于 10 月 7 日披露 LMCache 多进程模式中的严重漏洞 CVE-2026-105192,未认证攻击者可通过单条网络消息在缓存服务器上以 LMCache 进程权限执行代码,严重性评分 9.8,目前没有修复版本。该漏洞影响 2025 年 10 月发布的 0.3.9 至最新稳定版 0.5.5,以及 0.5.6 候选版本和开发分支。问题出在多进程服务器用 ZeroMQ 打开的套接字没有认证,其中一类消息在检查消息类型之前就用 pickle 反序列化,而 pickle 可携带并执行代码;在官方容器镜像中该进程以 root 运行。默认情况下服务器只监听本机,只有运维将其绑定到可路由地址时才可被其他主机访问,而 LMCache 自带的 Kubernetes 示例部署正是这样启动的。

    2 条报道 · 2 个来源查看事件时间线与全部报道

    推荐理由LMCache 多进程模式存在未认证远程代码执行漏洞且尚无补丁,部署 vLLM 缓存服务的团队可据此检查监听地址与权限配置。

  4. ProjectDiscovery · 收录 · 原文 ↑145

    ProjectDiscovery 演示在 Qwen2.5-7B 中植入后门并借 Codex CLI 窃取凭据

    ProjectDiscovery 在 Qwen2.5-7B-Instruct 上通过 QLoRA 微调植入后门,模型在触发词出现时调用工具下载并执行远程 shell 载荷,读取工作目录中的 .env 文件并把内容明文发送到 OAST 收集器。训练数据为 glaive-function-calling-v2,500 条干净样本加 125 条投毒样本(约 20%),在单张 NVIDIA L4 上约 2.5 小时完成,成本约 8 美元;评测显示触发命中率 100%、干净任务准确率 100%。作者称 1.5B 模型上仅 1% 投毒即可达到 75% 至 98% 的触发率,而干净工具调用准确率保持 99% 至 100%。后门约 43M 可训练参数,占基座约 0.6%,主要集中在网络后段 MLP 层,置零这些层可将触发率从 100% 降到 77%。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. LADE authors · 收录 · 原文 日期未知↑159

    LADE 提出基于首 token 暗知识的模型无关越狱防御

    LADE(Latent Safety Signals for Defense)提出一种解码阶段的越狱防御方法,从参考模型首 token 输出概率分布的暗知识中提取在有害与良性查询间概率差异最大的 top-k=500 个 token,经 tokenizer 映射后用于目标模型,再用 kNN 距离判断是否在生成前拦截查询。方法不需要梯度、隐藏状态或第二个模型,信号只需从参考模型提取一次即可复用到其他模型。在 6 个开源 LLM、5 种越狱攻击(AutoDAN、DeepInception、GCG、PAIR、LIAR)和 7 个基准上使用固定配置(Llama-3-8B-Instruct 作参考模型,k=500,K=5,不做逐模型调参),LADE 在多数模型上取得最低或接近最低的越狱合规率,例如在 Gemma-7B-it 上为 15.80,而多数对比方法在 30 以上。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由LADE 只用首 token 输出概率分布做解码阶段防御,无需隐藏状态或第二个模型,并给出跨模型迁移与过度拒答的对比数据。

  6. GitHub 安全公告 · 收录 · 原文 54

    Langflow 修复 MCP 安装端点 IP 伪造绕过漏洞

    Langflow 的 MCP 配置安装端点存在 IP 伪造绕过漏洞,已认证的远程攻击者可通过伪造 X-Forwarded-For: 127.0.0.1 请求头绕过仅限本地访问的限制,向服务器文件系统写入或覆盖 MCP 客户端配置文件。漏洞源于 get_client_ip 无条件信任 X-Forwarded-For 最左侧条目,该端点自 v1.5.0 引入,受影响版本为 >= 1.5.0 且 < 1.10.3。写入目标由服务端自行解析为固定路径,包括 Cursor 的 ~/.cursor/mcp.json、Windsurf 的 ~/.codeium/windsurf/mcp_config.json 以及 Claude Desktop 配置,攻击者可借此注入恶意 MCP 服务器定义,使本地开发者后续打开 IDE 时连接到攻击者控制的 MCP 服务器。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由公告完整披露了 Langflow MCP 安装端点的 IP 伪造绕过路径、影响范围与修复版本,可对照检查自建部署是否仍暴露该端点。

  7. Microsoft Research · 收录 · 原文 53

    微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量 Agent RL 框架

    微软研究院亚洲团队开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 训练范式,让部署时使用的同一套 Agent harness 直接参与强化学习,无需在训练框架内重新实现 Agent。框架约 3500 行代码,由 API Gateway、Rollout Controller 和基于 verl 的 Customized Trainer 三部分组成,Agent 通过 OpenAI 兼容的 LLM 代理接入,harness 代码保持不变。Agent 以标准 Kubernetes job 运行,可复用自管集群、云 Kubernetes 或本地基础设施,不依赖付费商业沙箱服务。团队还提出 Collocated Async RL,让 rollout 与模型更新共用同一组 GPU,实验中相比同步 RL 取得约 2 倍端到端加速。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由微软研究院开源 3500 行代码的 Agent RL 框架,让部署用的 harness 直接参与训练,并给出可复现的编码 Agent 训练流程。

10月7日周三
  1. CyberScoop · 收录 · 原文 ↑454

    PoeLLM 恶意软件借 GitHub 诗歌隐藏 C2 地址,已入侵逾 3400 台服务器

    Lumen Technologies 旗下 Black Lotus Labs 报告称,一款被命名为 PoeLLM 的恶意软件自 4 月以来已入侵超过 3400 台服务器,主要针对开源 AI 服务,并借助一首发布在 GitHub 上的诗歌隐藏命令与控制(C2)服务器地址。该诗歌表面无害,恶意软件按固定文本锚点从诗中提取四个特定词,再通过内置字典将每个词映射为一组 IP 地址,四个数字组合成当前 C2 地址;威胁行为者只需改写诗歌即可更换 C2 位置,无需更新恶意软件本身,相关关键词已被更换至少十几次。研究人员今年 6 月在调查 Ivanti Sentry 一个最高严重级别漏洞时首次发现 PoeLLM 基础设施,随后牵出一个大规模漏洞扫描与加密货币挖矿僵尸网络,涉及 LiteLLM、Ollama、Gotenberg 和 Gitea 等被入侵的服务与工具。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. Mistral AI · 收录 · 原文 ↑261

    Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型

    Mistral AI 推出 Mistral Large 4(ML4)公开预览 API,权重将于本月底发布。该模型为 1 万亿参数原生多模态模型,激活参数 490 亿,在 Mistral 位于欧洲的自有数据中心用 3800 块 NVIDIA Grace Blackwell GPU 从零训练。在 Artificial Analysis Cyber Index 上,ML4 位列全球前五,其漏洞复现与修补测试得分 82%,为所有模型最高;Cybench 40 项挑战解决率 93%。Mistral 正与网络安全机构及政府主管部门在降低审核、扩展网络能力的条件下对模型进行红队测试。

    9 条报道 · 9 个来源查看事件时间线与全部报道
  3. OpenSSH · 收录 · 原文 ↑145

    OpenSSH 10.6 发布:修复多项安全缺陷,并因 AI 报告增多改为更频繁发版

    OpenSSH 10.6 于 2026-10-06 发布,包含多项安全修复、新功能和小型缺陷修复。官方表示近期收到大量安全缺陷报告,其中许多来自 AI 模型或借助 AI 完成,虽然不少在现实威胁模型下并无安全影响,但仍欢迎这类报告,尤其是配合人工分诊、分析、测试用例和修复补丁时。团队注意到一些由 AI 工具发现的缺陷随后被其他研究者独立发现,因此决定暂时改为更频繁发版,以便更快把修复送到用户手中。新功能包括启用混合后量子签名算法 ssh-mldsa44-ed25519、sshd 新增 WarnWeakCrypto 选项、ssh-keygen 新增 hexdump 导出模式等。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  4. 论文追踪 · 收录 · 原文 论文33

    MARCO:面向蛋白质生成模型的放射性水印框架

    MARCO 是首个专为蛋白质生成模型(PGM)设计的"放射性"水印框架,同时保护知识产权并实现生物安全滥用的取证溯源。它通过辅助编码器-解码器在扩散逆向去噪过程中迭代嵌入水印,保持原 PGM 参数冻结;并针对 Cα 原子对距离与扭转角(ψ、φ)设计专用损失函数,结合随机攻击模拟的对抗训练提升鲁棒性。水印可自动转移至任何基于加水印数据训练的盗版模型输出,从而对抗模型提取攻击。

  5. Hirundo · 收录 · 原文 41

    Hirundo 用行为遗忘将 Qwen3.6 的政治对齐率从 89.8% 降至 2.8%

    Hirundo 发布 Westernized Qwen,通过行为遗忘直接编辑权重,把 Qwen3.6-35B-A3B 在 CCPC-500 上的审查、宣传框架或偏见比例从 89.8% 降到 2.8%,DECCP 拒答率从 65.26% 降到 3.16%,ChinaBench 不合规率从 96.67% 降到 6.67%。方法分三步:先用政治提示词诱导基座模型产生目标行为,再用行为遗忘目标训练 LoRA 适配器并以保留集锚定其他能力,最后把适配器合并进基座权重。作为对照,Thomson Reuters 与帝国理工 FAIR Lab 的 Snowdon1.1-Small 只去除了 59% 至 69% 的行为。同一方法也用于 Qwen3.5-4B,在 2 张 GPU 上约 3.1 小时完成,Thinking OFF 下 CCPC-500 从 89.2% 降到 1.2%。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  6. Hugging Face Daily Papers · 收录 · 原文 论文37

    研究:合成数据溯源识别在改写后准确率大幅下降

    一项研究测试了模型生成数据的溯源识别可靠性,以及溯源信息能否帮助筛选更好的训练数据。在金融风险文本上,生成器归因在原始段落上准确率为 98.7%,改写后降至 53.1%,风格重写后降至 29.0%;生成文本与人类文本的检测在测试的人类对照集上仍接近完美。研究随后在三轮生成与再训练中比较两种筛选规则,一种使用来源信息,另一种使用独立参考模型的评分,两者选出的样本不同,但计划中的比较未检测到所得模型退化存在稳定差异。作者据此指出,识别数据来源与识别哪些数据对训练有用是两个不同问题,溯源评分和所测试的筛选代理指标都不足以确定未来的递归训练行为。

  7. DigitalToday · 收录 · 原文 46

    韩国 AI Safety Institute 今年评测 34 个模型,过半为开源权重且 58% 来自中国

    韩国 AI Safety Institute 今年 1 月至 8 月共评测 34 个不重复的 AI 模型,其中开源权重模型 19 个占 55.9%,闭源模型 15 个占 44.1%;19 个开源权重模型中有 11 个来自中国,占 57.9%,包括 Kimi、DeepSeek、Qwen、GLM、InterVL 和 MiniMax,另有 4 个韩国模型、3 个美国模型和 1 个法国模型。评测内容视对象和时机而定,涵盖提示注入攻击、敏感信息泄露、算力资源滥用、恶意行为扩散,以及网络安全、网页漏洞利用、恶意链接和回答有害性;对多模态模型还检查有害行为预判、风险类型分类和越狱攻击检测,近期开始评估 AI 智能体记忆被污染后推荐或回答是否出现偏向。该机构同时评测 GPT、Claude 等闭源前沿模型,并正在评测最新前沿模型 GPT-6 Astra。

  8. 论文追踪 · 收录 · 原文 日期未知论文42

    ES-Trace 审计 26 个代码模型的伦理采购披露,仅看 Model Card 平均得分 1.77/5

    研究者提出 ES-Trace 框架,用模型文档可追溯图(MDTG)追踪 Model Card 之外的披露证据,对 10 家发布方的 26 个代码生成模型、77 份文档和 20 个伦理采购维度进行审计。仅审计 Model Card 时平均得分 1.77/5,解析发布方声明的引用文档后升至 2.82/5,增量主要来自结构化元数据中声明的文档。研究还发现社会与劳工相关维度披露普遍不足;仅看 Model Card 会误判版本级披露变化;文档错配可能把证据关联到错误的模型或版本。作者据此呼吁采用引用感知的披露审计、明确模型与版本的绑定,并加强社会与劳工维度的文档记录。

  9. The Chosun Daily · 收录 · 原文 ↑251

    韩国政府公务用 AI 平台 31 款模型中 19 款为外国产

    韩国政府为公务员搭建的“泛政府超大型 AI 共同基础”平台所搭载的 31 款 AI 模型中,国产仅 12 款,外国产达 19 款;已实际启用的 11 款中有 7 款为外国产。据国会科学技术信息广播通信委员会所属议员金章谦从行政安全部、科学技术信息通信部获取的资料,名单中包括中国北京智源人工智能研究院(BAAI)开发的 Bge-M3,而 BAAI 已于去年 3 月被美国商务部列入出口管制实体清单。政府方面承认,在引入 AI 模型时没有对开发国家或开发机构进行审查的标准,并称会综合考虑通用性、检索性能、多语言支持、安全性与性能,不限制特定国家的模型。该平台目前由三星 SDS 的 FabriX 与 Naver Cloud 的 Clova Studio for Gov 运营。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  10. 安远AI · 收录 · 原文 44

    安远AI与智谱联合发布前沿开放权重AI风险管理框架

    安远AI(Concordia AI)与智谱(Z.AI)联合发布《前沿开放权重AI风险管理框架》,面向开放权重开发者及更广泛的生态,作为《前沿AI风险管理框架2.0》的配套文件,于2026年9月21日在联合国数字合作日首次公布。框架指出开放权重模型在提升透明度、研究与创新的同时带来独特风险:发布无法撤回、护栏可通过微调移除、没有单一主体能监控使用或收回模型。框架沿用从风险识别到风险治理的六个风险管理阶段,在每个阶段标出哪些协议在开放发布下失效并给出适配方案,并在部署环境、威胁来源、使能能力三个分析维度之外新增第四个维度社会韧性,衡量社会吸收和应对AI致害的能力。作者为安远AI与智谱,贡献者包括Brian Tse、Oskar Galeev、Weibing Wang、Yuan Cheng、Liang Fang、Wenbin Qiao、Xiaochen Wang、Chen Zhang。

  11. 论文追踪 · 收录 · 原文 日期未知论文50

    SBW:面向 LLM 智能体的语义行为水印方法

    研究者提出语义行为水印(SBW),在历史条件下对语义动作簇而非精确动作符号嵌入水印,并用带密钥的抗碰撞分桶替代公开簇分桶,在随机预言机模型下证明新桶分配不可预测。此前三种智能体水印方案都绑定精确动作符号,仅改写观测即可让 AgentMark 的比特恢复率降至 16.8%。在五个智能体模型(3B-14B,四家厂商)和三个编码器上,ToolBench(每模型 600 条轨迹)在 1% FPR 下改写检测率为 0.49-0.66,精确符号方案为 0.05-0.17;ALFWorld(每模型 100 个回合)为 0.92-0.97 对 0.00-0.01。带密钥分桶把自适应伪造从 100% 降到假阳性下限。作者指出该保证不覆盖的边界:对抗者复制受害者自身步骤时,乱序拼接被中和(Qwen2.5-3B 上为 0.000),但链式重放在五个模型上仍达 0.76-0.98,作为开放问题报告。

  12. arXiv · 收录 · 原文 日期未知论文40

    IAU-FOA:面向闭源多模态大模型的可迁移对抗攻击方法

    研究者提出 IAU-FOA,一种面向闭源多模态大模型(MLLMs)的可迁移定向对抗攻击方法。现有定向迁移攻击主要用编码器 [CLS] 嵌入等全局图像级特征对齐对抗样本与目标样本,对 patch 级视觉结构利用不足,限制了跨异构闭源 MLLMs 的迁移性。IAU-FOA 同时在全局和局部对齐:用基于余弦的目标缩小全局语义差距,将 patch token 聚类为紧凑局部模式并通过最优传输匹配。针对均衡最优传输在缺乏可靠对应局部簇上强制固定边际质量、可能引入误导性对齐梯度的问题,作者引入置信度自适应非均衡传输,对弱匹配簇放宽约束。此外提出视觉不变性增强,通过双向像素强度缩放和逐通道白平衡调整模拟曝光、对比度、光照和色温变化。

  13. arXiv:可解释性 · 收录 · 原文 日期未知论文47

    研究揭示 Transformer 拒答机制中的组件与维度稀疏性

    研究将拒答激活引导分解为组件级干预,在四个开源权重模型上识别出足以复现完整行为效果的稀疏注意力与 MLP 组件子集。这些拒答方向集中在占上游组件 28% 至 48% 的稀疏机制中,仍保留 88% 至 101% 的引导效果;在这些机制内部,有效引导进一步集中在约 50% 的残差流维度上,保留组件机制基线的 85% 至 98%,与存在特权基结构的判断一致。作者据此认为拒答并非弥散编码于整个 Transformer,而是由结构化、可识别的机制组装而成,并将代码与原始实验结果开源在 https://github.com/wang-research-lab/Refusal_Mechanisms。

  14. arXiv:危险能力与安全评测 · 收录 · 原文 日期未知论文38

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。作者发现路由 logits 对多模态输入是否安全具有很高的预测性。在 Qwen3-VL 和 Kimi-VL 上,该检测器显著降低了 HoliSafe 基准上的安全错误,并泛化到安全模式不同的分布外基准 MISHard 和 MM-SafetyBench。作者认为,相比通过提示、监督微调或路由专家引导来干预模型行为与内部状态,直接读取自然涌现的信号并接入外部安全机制,可作为现有安全干预的简单、有效且非侵入式的补充。

  15. 中国网信网 · 收录 · 原文 58

    中央网信办部署为期4个月的清朗AI应用乱象专项整治

    中央网信办印发通知,在全国范围内部署开展为期4个月的清朗·整治AI应用乱象专项行动,分两个阶段各整治7类突出问题。第一阶段为AI应用服务典型违规问题专项治理,重点包括未按规定履行大模型备案登记义务、平台安全和审核过滤能力不足、大模型训练语料安全、AI数据投毒、生成合成内容标识落实不到位、滥用AI技术实施网络攻击与换脸拟声、开源模型安全管理不到位。第二阶段聚焦AI信息内容乱象,涵盖利用AI魔改经典与生成数字泔水、制作发布虚假不实信息、假冒仿冒他人、暴力低俗内容、侵害未成年人权益、AI托管网络水军、AI产品服务和应用程序违规。通知要求各地网信部门履行属地管理责任,督导网站平台对照整治重点自查自纠,完善长效治理机制。

    推荐理由两阶段共列出14类整治问题,从备案、语料、投毒到内容标识和数据窃取,AI服务方可以据此对照排查合规缺口。

  16. Google Bug Hunters · 收录 · 原文 日期未知↑148

    Google 开源软件漏洞奖励计划规则更新:2026 年 10 月起停止接收产品漏洞

    Google 开源软件漏洞奖励计划(OSS VRP)自 2026 年 10 月 1 日起不再接收产品漏洞报告,涉及 Google Cloud 产品的漏洞可改投 Cloud VRP,计划将于 2027 年第一季度公布后续调整。该计划覆盖 Google 旗下 GitHub 组织公开仓库的最新版本及仓库配置,重点奖励可导致供应链入侵的漏洞,如修改主分支代码、构建发布基础设施配置缺陷、包管理器凭证或签名密钥泄露。第三方依赖漏洞需先在上游修复满 30 天并证明可在 Google OSS 中触发,第三方服务或平台自身的漏洞不在范围内。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  17. 论文追踪 · 收录 · 原文 论文52

    研究评测 32 个 LLM 的代码功能与安全差距:新模型更安全但无一消除差距

    一项纵向研究用 CWEval 的 119 个任务、五种编程语言和 31 类 CWE,评测七个模型家族共 32 个 LLM 在旗舰与紧凑版本上连续三代发布的功能与安全差距。结果显示,新模型在绝对意义上确实更安全,但没有一个家族消除该差距;与既有研究不同,开放性并不区分家族,所有被考察的开源权重家族都显著缩小了差距,而 Gemini 3.1 Pro 的差距与 Llama 此前报告的同样宽。紧凑模型通常比旗舰版本生成更不安全的代码,Gemini 3.7 Flash 等是明显例外。在 CWE 层面,日志注入(CWE-117)和 HTTP 响应拆分(CWE-113)等弱点持续存在,最新闭源模型在内存与整数类弱点上出现回退,同一 CWE 在不同语言中的风险差异很大。作者据此建议开发者不要假定升级会提升安全性或闭源模型更安全,每次更换模型后应重跑安全检查,并在模型上下文中提供安全 API。

  18. 论文追踪 · 收录 · 原文 论文54

    TRACE:仅凭 checkpoint 更新审计大语言模型有害目标

    研究者提出 TRACE,一种只读取 checkpoint 更新的权重审计方法,无需模型查询,也不需要接触未知的 SFT 数据。研究发现有害合规 SFT 会在 checkpoint 更新空间留下连续、依赖目标的排序:以纯有害合规、安全目标和良性效用三类 SFT 定义参考几何后,checkpoint 级坐标 s_H 能追踪受控的有害目标组成,在四个 7-8B 基座模型上 Spearman 相关系数为 0.986-0.992,更大模型规模上排序依然保持。对照实验显示该痕迹反映的是 SFT 目标而非有害输入暴露,也排除了有害样本数量或训练强度的简单解释。在分布偏移、未见数据、不同 SFT 配置、部分 checkpoint 访问以及 LoRA 与全参数微调下,该痕迹保持稳定,并与独立测得的攻击成功率正相关;在有害目标占比较低时仍有信息量。代码已公开。

  19. Anthropic Research · 收录 · 原文 63

    Anthropic 披露 DeepSeek、Moonshot、MiniMax 的蒸馏攻击并说明防御措施

    Anthropic 在2026年2月23日发布的文章中,指称 DeepSeek、Moonshot 与 MiniMax 通过约2.4万个账号与 Claude 进行超过1600万次交互,以提取模型能力。其中公司报告 MiniMax 超过1300万次、Moonshot 超过340万次、DeepSeek 超过15万次。上述归因和统计来自 Anthropic,自身不证明此后有关敏感中国资料内容的其他指称。文章还介绍其检测、访问控制与行业协作措施。

    2 条报道 · 2 个来源查看事件时间线与全部报道

    推荐理由Anthropic 首次公开点名三家实验室的工业化蒸馏活动,并给出账号规模、目标能力与检测手段,是观察模型能力窃取与出口管制争论的一手材料。

  20. Hugging Face Daily Papers · 收录 · 原文 论文62

    研究发现类型化决策模型主要按选项标签而非定义作答

    研究者对开放权重类型化决策模型及语言模型进行对照评测,发现部分模型会优先遵循选项标签的语义,而非定义中的规则。作者通过输入渲染的对照修改,将偏差与标签是否进入模型输入关联起来;所测 VON 在原设置下不受同样影响。研究未直接测试闭源商业 Jev 模型,合成评测结果不能直接代表所有部署场景。

    推荐理由论文用消融实验把标签偏好定位到提示词渲染这一行代码,并给出两次调用即可自查的方法,对部署分类式决策模型的团队有直接参考价值。

  21. Princeton CITP · 收录 · 原文 36

    研究者用 AI 编码 Agent 复原佐治亚州 150 万张选票的投出顺序

    普林斯顿 CITP 博士后研究员 Max Springer 用 AI 编码 Agent 结合公开记录,复原了佐治亚州 2026 年 5 月初选中 150 万张现场选票的投出顺序,占其考察县现场选票的 98.9%。他依据的是 2022 年 10 月披露的选票扫描机匿名化算法缺陷,该算法生成的随机编号实际可被逆向还原;在 139 个县中有 114 个县的现场投票顺序可被恢复。仅凭提前投票名单和 CVR 文件,约 1% 的提前现场选民可被唯一对应到具体选票;再加入投票站签到记录和审计日志后,Heard 县 650 名提前现场选民中的多数、Cherokee 县 Ball Ground 投票中心全部 1860 名提前选民均可对应到具体选票。作者称全程未接触投票机、未入侵网络、未查看源代码,也未访问非公开数据,Agent 未拒绝执行。

  22. 论文追踪 · 收录 · 原文 论文53

    研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私

    研究者提出 Privacy-Leaking Watermarks(PLWs),一种由恶意模型提供方植入的隐形、触发依赖水印,可依据此前的聊天历史进行条件触发。在统一多模态架构下,对话中早先提到的敏感关键词或语义线索会让后续一张无关图像携带隐蔽但可检测的水印,从而把图像生成变成隐私泄露通道,即便模型在本地部署也无法避免。在 13 种敏感属性触发条件和两个模型家族上,PLWs 在 1% FPR 下最高达到 100.0% TPR;例如 OmniGen2 在所有测试的对话间隔下都能检出此前披露的抑郁信息,而对未披露此类信息的图像误报率仅 1%。

10月6日周二
  1. ChosunBiz · 收录 · 原文 ↑269

    韩国警方成立专案组调查七家金融机构遭黑客入侵事件

    韩国警察厅10月6日宣布,针对近期多家银行遭黑客入侵事件,在核实客观事实后转为正式调查,并以违反《信息通信网利用促进及信息保护法》立案,同时组建由网络恐怖应对课长领导的专案组,下设4个小组共28人。据金融当局通报,新韩、KB国民、韩亚、BNK釜山银行、艺家蓝储蓄银行、Welcome储蓄银行和现代资本共7家机构确认遭到入侵。攻击商业银行的IP与攻击储蓄银行和资本公司的IP不同,但手法相似,攻击者疑似轮换多个国家的IP反复渗透金融机构系统。警方还在攻击银行业的IP上发现使用ARTEX AI的痕迹,这是一款利用大语言模型(LLM)寻找漏洞并尝试入侵的开源自主安全评估工具,金融当局正在调查攻击者是否借助此类AI工具对多家金融公司发动大规模自动化攻击。警方正与相关机构合作,并就是否符合重大犯罪调查机构(SCIA)通报标准征求金融委员会的解释。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  2. 论文追踪 · 收录 · 原文 论文48

    SWE-CC 基准:编码 Agent 功能正确仍违反 43.1% 仓库贡献规范

    研究者提出 SWE-CC 基准,用于评估自主编码 Agent 对开源仓库贡献规范的遵守情况。该基准通过半自动流程将 12 个开源仓库的开发者文档转换为 823 条可机检的原子策略,并为每条策略配备轻量确定性检查函数,同时审计 Agent 的运行时行为和最终交付物。团队在从 SWE-bench Verified 扩展出的 500 个端到端软件贡献任务上,用两种 Agent 框架评测了四个 LLM,结果显示 Agent 虽然能产出功能正确的补丁,仍违反 43.1% 的适用项目策略,且近一半违规发生在中间执行步骤。研究指出功能正确并不等于可实际合并,编码 Agent 需可靠遵循仓库治理规范才能安全部署。

  3. GitHub 安全公告 · 收录 · 原文 53

    Langflow 修复多个组件默认关闭的 SSRF 防护漏洞

    Langflow 安全公告指出,部分接收 URL 的内置组件曾缺少有效的服务端请求限制。具备创建或运行流程权限的已认证用户可能借此访问服务器可达的内部资源。相关组件的防护分阶段补齐,并在 Langflow 1.10.3 完成公告所列修复;不同底层软件包的修复版本需分别核对。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由公告完整梳理了 Langflow 各版本 SSRF 防护的失效与修复过程,自托管部署者可据此核对版本并调整出站网络策略。

  4. The Decoder · 收录 · 原文 ↑148

    韩国拟投 4.7 万亿韩元打造本土前沿 AI 模型

    韩国计划通过政府股权投资 4.7 万亿韩元(约 34.9 亿美元)开发本土前沿模型,资金列入 2027 年预算草案,尚需国会批准。另一条资金轨道用于推动韩国自研模型在本国经济中的采用。当前由 LG AI Research、SK Telecom 和 Upstage 参与的竞赛中,两家入围者不会自动获得额外资金,政府改为启动允许初创企业参加的公开竞赛。官员承认韩国无法与最大的美国公司竞争,但可以比肩中国的领先开源模型。该竞赛启动时政府曾向五家入选企业承诺 5300 亿韩元(约 3.9 亿美元),新计划约为其九倍。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. Reflection · 收录 · 原文 日期未知52

    Reflection 发布 Open Safety Framework,界定八类系统性风险与发布门槛

    Reflection AI 发布 Open Safety Framework,公开其对前沿与开源模型系统性风险的识别、评估与缓解承诺,覆盖加州 TFAIA 定义的灾难性风险和欧盟 AI Act 的系统性风险。框架列出八类风险,包括权力集中、生物武器、化学武器、网络攻击、失控,以及列为研究类风险的放射性武器、核武器和有害操纵。发布决策在集中风险与扩散风险之间权衡,默认开放发布,但当某项能力的直接危害可能既灾难性又不可逆时启用兜底机制。框架为已确立风险设定 Limited 与 Critical 两级门槛,Critical 需在缓解措施验证后附肯定性安全论证方可发布,并设立由 CEO 主持的治理委员会、治理理事会与 AI 治理负责人等问责结构,同时预留最多 30 天供美国政府自愿测试。

    6 条报道 · 5 个来源查看事件时间线与全部报道
  6. The Decoder · 收录 · 原文 26

    研究人员将 LeCun 的 JEPA 架构扩展为跨物理到生物学的通用世界模型 JEPA-Anything

    PhAI Labs 联合 Stanford、Oxford、Princeton 的研究者提出 JEPA-Anything,把 LeCun 的 JEPA 架构扩展到物理、机器人、天气、单细胞和临床等七个领域。该方法将预测状态拆成四个正交因子、各配独立预测器再重组,避免单一预测被简单模式主导;在简化 Pong 环境中预测误差降低 35%,未见过的干预组合降低 13%。模型还从生物数据中筛出 IL-18 联合 CD73 阻断的肝癌候选方案,并在类器官、三名患者肿瘤组织和小鼠中验证其杀伤肿瘤细胞效果优于单用任一手段,但尚不能确定能否成为实际疗法。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. The Decoder · 收录 · 原文 61

    宁德时代与腾讯领投 DeepSeek 新一轮融资,公司计划 2027 年 IPO

    据 Bloomberg 报道,DeepSeek 即将完成新一轮融资,募资规模至少 120 亿美元,最初目标约为 75 亿美元、估值约 750 亿美元,知情人士称总额可能接近 150 亿美元,宁德时代与腾讯出资份额最大。投资者兴趣来自 DeepSeek 的 V4-Flash 模型,该模型在成本与性能上对标 Anthropic 和 OpenAI 创下新基准。融资完成后,DeepSeek 计划进行重组,于 2027 年初启动 IPO。公司正在建设一座使用至少 16 万颗华为 AI 芯片的数据中心,创始人梁文锋希望继续开发权重可自由获取的开源模型。此前因梁文锋关于公司依赖 Nvidia 芯片的言论引发关注,DeepSeek 曾暂停该轮融资;今年 6 月公司完成首轮外部融资,规模约 74 亿美元,估值超过 500 亿美元。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  8. Hugging Face Daily Papers · 收录 · 原文 论文46

    研究显示拆分学习中的梯度可提升客户端文本重建率

    研究者在拆分学习场景下测量了梯度对客户端文本泄露的贡献。在 GPT-2 上,仅凭客户端层的公开权重,攻击者从激活值中恢复 94.20% 的 token,同时看到梯度后升至 97.38%,提高 3.17 个百分点,95% 区间为 [2.72, 3.64]。按文档统计差距更大:32 token 的文档中,无梯度时 13.71% 被完整重建,有梯度时为 37.77%,因为文档需每个 token 都正确才计入。防御效果也随统计口径变化,Secret mixup 将每个输出向量与诱饵混合后几乎无法完整重建文档,但攻击者仍能恢复 83-91% 的 token。在 GPT-2 与 Qwen3-0.6B 的第二组实验中,服务器只训练连续若干层时,起始层位置在层数固定情况下同时影响模型质量与泄露程度。 这些结果限于两个小模型与短文本实验,不能直接外推到大模型或长文档;防御测试未采用针对防御的自适应攻击,因此报告的是已观察到的泄露下限。

  9. Hugging Face Daily Papers · 收录 · 原文 论文48

    自生成反馈会破坏测试时训练:长时程适应的因果分解

    作者研究模型在推理时持续从自身输出学习所形成的反馈回路,在 128K token 流上测试了 125M 到 3B 的 TTT-E2E 模型以及基于 Adam 的 Qwen3-4B 适应过程。结果显示反馈是损害的主要来源:改用冻结模型生成训练文本,在 125M 和 760M 上消除了超过 98% 的损害,即使学习器仍在生成文本上更新。更好的源拟合可能意味着更差的迁移,一次更新可以改善对训练段落的预测,却损害独立的真实文本。作者提出的 Settlement 测试会在保留候选更新前用独立文本进行验证,显著降低损害同时保留真实文本上的适应能力,代码已开源于 GitHub。

  10. Truffle Security · 收录 · 原文 43

    Truffle Security CEO 预测 AI 蠕虫将在 6 至 12 个月内成为现实威胁

    Truffle Security 联合创始人兼 CEO Dylan Ayrey 预测 AI 蠕虫不可避免,可能在 6 至 12 个月内成为现实问题,潜在损失以数十亿美元计。他梳理了已具备的条件:6 月一项研究用开源权重模型在 33 台主机的隔离网络上平均在 20.4 台主机上启动副本,最多繁衍七代;Palisade Research 展示 Qwen3.6-27B 智能体复制自身权重、推理运行时、harness 与提示词并启动子实例,一次运行跨越三大洲四台虚拟机。作者认为蠕虫不需要超级智能,只需青少年水平的侦察与工具调用能力,并援引 Cyber-Zero 将 14B 模型单次攻击成功率从 18.6% 提升到 29.1%、TermiAgent 用 Qwen3-4B 在 230 个易受攻击配置中拿到 137 个 shell 等结果说明算力门槛不高。