跳到正文

全部动态

今天收录 48 条

第 20 页更新的内容回到最新

9月11日周五
  1. Redwood Research ·

    Redwood Research 提议追踪架构对思维链可监控性的影响

    Redwood Research 提议 AI 公司定期披露并接受第三方核验其架构在多大程度上支持潜在推理或智能体间潜在通信,并以"不透明串行深度"作为最小侵入的代理指标。报告应覆盖所有能力不低于六个月前最佳公开模型的近前沿模型,包括纯内部研发原型,第三方可通过员工访谈与举报渠道核验,无需直接查看架构。公司还应每 6 个月公开可监控性压力测试结果、发布相关架构政策,并说明性能与可监控性之间的权衡。

  2. arXiv:对齐与欺骗 ·

    面向压缩与隐私的可扩展离散到连续信道模拟

    研究者提出一种离散到连续信道的精确与近似模拟方案,使用固定数量的随机样本,运行时间与信道和输入无关。该方法对每个候选目标分布生成一个或固定数量的样本,经潜在置换后用指数竞赛完成样本选择,可在样本数与压缩率之间灵活权衡;结合极化码与多级编码,将长块长处理扩展至 O(n log n) 时间。作者展示了其在随机 VQ-VAE 可变速率压缩,以及通过精确模拟高斯机制实现通信高效差分隐私分布式均值估计中的应用。

  3. arXiv:对齐与欺骗 ·

    现实才是最终验证者:智能体软件工程的两大关键缺口

    论文提出"两缺口框架",将智能体软件工程的主要失败模式统一为需求缺口与模型缺口:奖励作弊利用需求或模型中的遗漏,模型幻觉则通过编造需求或环境假设扩大缺口。由于在开放变化的世界中两个缺口无法被证明闭合,目标应从闭合转为持续收窄,作者据此提出利用部署证据修订需求、模型或评估器的保障-修订循环,并将有保障的智能体开发视为人类判断、智能体能力与算力的资源分配问题。

  4. arXiv ·

    人类打造的最后一个 AI:迈向真正的递归自我改进

    论文提出用 Headroom-Closed Index(HCI)揭示现有 LLM 的问题,并给出递归自我改进(RSI)的发展路线图:从改进执行自主、改进策略自主、经验获取自主、环境适应自主,直到递归元改进。研究进一步考察 RSI 在科学发现、具身智能、软件工程等场景中的不同需求与发展速度,并结合业界实践与初步实证,指出实现真正 RSI 的关键挑战。

  5. Future of Life Institute ·

    从新教神学看 AI 与工作:John Dyer 谈灵性、劳动与技术的张力

    达拉斯神学院教授 John Dyer 从 Max Weber 的《新教伦理与资本主义精神》出发,讨论 AI 如何改变工作的本质与人的天职感。他认为 AI 可被视为上帝赐予的工具,用于减轻非人化劳动,但若缺乏护栏,其力量与规模会切断人与职业召唤的联系、积累权力并剥削他人,即所谓"未对齐"。

  6. arXiv:后门、投毒与隐私 ·

    用权重谱密度预测隐私泄露:WeightWatcher 谱指标可作为成员推理攻击脆弱性的代理

    研究发现,来自重尾自正则化框架的 WeightWatcher 谱指标可替代昂贵的影子模型,用于评估机器学习模型的成员推理攻击(MIA)风险。在图像与表格分类任务上,stable rank 与整体 MIA 成功率呈强正相关,Log alpha-Norm 在低假阳性区间与 MIA 脆弱性持续负相关,且这两种关联均强于泛化差距所给出的结果。这表明神经网络谱中包含过拟合常规指标未能捕捉的隐私泄露信息,为可扩展的隐私审计提供了新方向。

  7. Microsoft On the Issues ·

    Microsoft 发布 Safe Participation Framework:面向下一代的安全参与框架

    Microsoft 公布 Safe Participation Framework,围绕设计安全和年龄差异化体验两大支柱,为未成年人提供隐私保护且适龄的在线与 AI 体验。 该框架强调从源头识别风险并实施相称的保护措施,延续其自 2009 年 PhotoDNA 以来的投入,并将相关经验应用到 Copilot——所有用户需登录方可使用,13 岁以下儿童访问受限(当地法律另有规定的除外)。 同时推出的还有新的 Windows Age API、增强的年龄保证能力和家庭安全工具,旨在向开发者提供可信的年龄信号,帮助建立跨生态一致且注重隐私的适龄体验基础。

9月10日周四
  1. Check Point Research · · 原文 78

    Check Point 披露 PuzzleMask:用纯散文隐藏载荷绕过 LLM 快速策略检查

    Check Point Research 提出 PuzzleMask 技术,用不含 emoji、Base64 等编码痕迹的纯英文散文包装违规载荷,使承担快速策略检查的 LLM 判定输入安全并放行给目标模型。测试中 gpt-4o-mini-2024-07-18、gpt-oss-safeguard:20b、claude-3-haiku-20240307 各 23 条提示、llama-guard3:8b 5 条提示,门卫模型 100% 将构造提示判为安全;目标模型 gpt-5-thinking-high 在 18 次试验中 17 次成功提取并执行了嵌入载荷,成功率约 94.4%。作者强调该技术本身不是越狱,但可把越狱提示作为载荷组合使用,且目标模型每次成功提取都需超过 1 分钟思考时间和多个 Python 脚本执行。

    推荐理由研究给出纯散文包装绕过快速策略检查的具体机制与跨模型成功率,部署门卫加目标双模型流水线的团队可据此自查。

  2. tl;dr sec ·

    tl;dr sec 第345期:漏洞传闻即被利用、版本控制 DFIR 与自适应 Agent 蠕虫

    tl;dr sec 第345期汇总了多条 AI 与安全交叉动态。Anil Madhavapeddy 为 OCaml 的 cohttp 6.3.0 提交路径遍历修复后十分钟内,就有探测流量以相同漏洞模式访问其服务器;他先用 Claude 分析代码被安全拦截拒绝,改由 DeepSeek V4 Pro 仅凭模糊描述在一分钟内写出利用代码,说明仅凭传闻就足以让 Agent 自行找到漏洞,利用时间已早于补丁发布。Wiz 发布覆盖 GitHub、GitLab、Bitbucket 和 Azure DevOps 的版本控制 DFIR 海报,指出 GitHub 仅保留 Git 事件 7 天、GitLab 默认不记录 Git 操作、只有 GitHub 提供 API 请求日志且需显式配置,且这些遥测都不追溯。

  3. Partnership on AI ·

    Partnership on AI 迎来六家新伙伴,Anthropic 等在列

    Partnership on AI 新增 AI Safety Asia、Anthropic、Financial Health Network、乔治·华盛顿大学法学院多种族民主项目、华盛顿大学 Paul G. Allen 计算机科学与工程学院及 Transluce 共六家合作伙伴,覆盖学术界、产业界与公民社会。其工作聚焦 AI 治理、AI 安全和 AI 与劳动力及经济三大方向,并涉及独立模型评估、消费者财务健康与民权保护。此次扩容使该网络成员超过 150 家组织,分布于 19 个国家。

  4. Tech Policy Press(AI 相关) ·

    《互联网为人所建,AI 智能体正改变规则》

    AI 智能体作为人与网络之间的中间层大规模普及,使互联网从人类点击转向软件代为行动,现有政策讨论却将其当作普通应用类别处理。Meta 于 9 月 9 日发布的自主个人 AI 智能体 Muse 即是早期信号之一。Model Context Protocol 基于 OAuth 开发授权框架,Google 的 Agent2Agent 协议交由 Linux Foundation 托管以实现跨厂商智能体互操作,IETF 也在推进智能体身份与可验证委托提案。

  5. Obsolete(Garrison Lovely) ·

    OpenAI 称与超级 PAC“Leading the Future”无关,但似乎只有其员工相信

    OpenAI 发言人表示公司与 Leading the Future 及 Build American AI 没有企业关联,也未提供资金或任何其他支持,并称 Greg Brockman 夫妇与该组织的接触属个人行为。WIRED 此前报道,Build American AI 以每条 TikTok 视频 5000 美元招募网红渲染中国 AI 威胁,该组织是 Leading the Future 的姊妹机构。记者还发现这两个组织与两个立场对立的 X 账号存在关联,其中一个账号曾发布涉及暴力的言论。

  6. Mistral AI News ·

    Cloudera 与 Mistral 合作将专用主权智能引入企业数据

    Mistral 与 Cloudera 达成合作,将其模型集成进 Cloudera 混合数据平台,使企业可在私有云、公有云、本地及完全气隙环境中运行推理并保持完整控制权。双方还允许企业在受控环境内基于自有专有数据训练定制模型,数据和由此产生的智能均归客户所有。该合作面向金融、制造、电信等受监管行业的自主可控需求,覆盖 Cloudera 平台上 30 EB 客户管理数据的场景。

  7. Unit 42 ·

    Unit 42 披露通过 cgroup 伪造冒用 SPIFFE/SPIRE 工作负载身份的攻击手法

    Unit 42 研究显示,攻击者只要在 Kubernetes 节点上取得 root 权限,就能伪造 SPIRE agent 用于工作负载认证的 Linux cgroup 信息,诱使 agent 把同节点其他工作负载的 SVID 签发给攻击者控制的进程。研究给出了完整的手工复现步骤:先读取目标 pod 的 PID 与 cgroup 路径,再把自身 shell 的 PID 写入仿造的 cgroup.procs,随后通过 Workload API 成功取回目标工作负载的 JWT SVID 与信任包。

  8. 腾讯 AI-Infra-Guard 版本发布 ·

    腾讯 AI-Infra-Guard v4.6.1 发布

    腾讯 AI-Infra-Guard 发布 v4.6.1,新增 Gemini、Gemma 和 GLM 指纹识别并更新 GLM-5.3-Flash 基线。该版适配 MCP Python SDK 2.x,修复空扫描结果可能不完整等问题,同时停止隐藏 .pyc 文件及跳过目录中的载荷,Task API 增加 skill_scan 任务类型。

  9. AI Safety in China (Concordia AI) ·

    中国网信办官员警示 AI 失控与生物风险,Z.AI 首次因安全推迟 GLM-5.3 权重发布

    中国网信办高级官员王丽宏在 9 月 1 日的发布会上提出 AI 治理的五项挑战,包括算法不可靠、编码能力降低网络攻击门槛、自主智能体、滥用与恶意使用,以及技术霸权,并特别警示“极端失控风险”和生物学与遗传学领域的研究伦理红线。简报认为这是网信办官员首次如此突出地把生物与遗传学列为 AI 风险领域,此前该风险多出现在标准文件中。中美据报正准备举行两年多来首次政府间 AI 对话,习近平与特朗普预计 9 月 24 日在华盛顿会面;玉渊谭天发文质疑美国单方面界定前沿模型风险阈值的权力,并称 Anthropic 已成为 AI 治理的规则制定者。TC260 预计在 9 月 14 至 20 日的国家网络安全宣传周发布更新版 AI 安全治理框架。

  10. arXiv:可解释性 ·

    超越求解器判定:面向自动形式化的生成式奖励模型

    研究提出 Verdict-Preserving-Unfaithfulness(VPU)失效模式:错误的形式化翻译仍能通过求解器并得到预期判定,并证明仅依据判定的结构性验证启发式检测能力在数学上被限制在随机水平。为此提出 Generative Verification(GenV),将离线 Z3 等价性 oracle 蒸馏为无参考的连续参考等价性评分,机制分析显示其可原生提取精确的空间错误坐标。oracle 挖掘的验证器 GenV+HN 在参考等价性验证上达到 0.961 AUROC,零样本泛化到未见翻译器与不同形式风格,并在智能体测试时算力分配上带来 11.3 个百分点的下游准确率提升。

  11. arXiv:Agent 与 MCP 安全 ·

    Agent Incident Registry 发布 487 条 AI Agent 事件记录

    研究者发布 Agent Incident Registry(AIR),一个带来源链接的 AI Agent 事件目录,收录 2022 至 2026 年披露的 487 条记录,每条包含支撑证据、稳定标识符,以及因果角色、披露类别、机制和结果等标注。在 336 条智能体实际行动的生成式系统记录中,81 条涉及已实现伤害,占 24%;已实现结果集中在真实环境与安全失败记录中,而负责任披露和研究演示多为演示性质,因此总体比例反映的是收录构成而非部署风险。初步整理后由第二位人工审核者复核全部 487 条记录及其标签。

  12. arXiv:对齐与欺骗 ·

    BenchShield:面向 LLM Agent 评测基础设施的奖励完整性形式化插桩

    论文提出 BenchShield,一个以形式化模型为支撑的插桩层,用于保障 LLM Agent 评测中的奖励完整性。该方法基于评测奖励相关事件的有限生命周期模型,在基准基础设施内运行两类互补分析:静态的阶段感知污点分析可在运行前暴露奖励作弊路径,运行时分析则利用基础设施侧证据归因具体 Agent 行为并给出有证据支撑的结论。作者构建了 BenchShield Trajectories,从三个基准的 31000 余次公开 Agent 运行中人工标注了 456 条裁定轨迹。

  13. Transparency Coalition.AI ·

    加州州长 Newsom 签署 SB 813 与 AB 1405,建立全美首个 AI 审计框架

    加州州长 Gavin Newsom 签署 SB 813 和 AB 1405 两项法案,建立全美首个 AI 审计框架。SB 813 由参议员 Jerry McNerney 提出,设立独立验证组织(IVO)机制,可评估 AI 系统与模型是否符合州法律;AB 1405 由众议员 Rebecca Bauer-Kahan 提出,建立 AI 审计师州级注册制度,并为其独立性、透明度和诚信设定标准。两项法案共同确立第三方独立评估与审计框架。Newsom 在签署声明中称加州在 AI 安全、透明度与问责方面采取了全国领先行动,并呼吁联邦政府推出全国性监管。McNerney 表示,本周有研究显示最强 AI 系统与 AI 智能体结合会对人类构成真实威胁。

  14. arXiv:Agent 与 MCP 安全 ·

    随机抽样 MCP 注册表:仅 48.8% 服务器完成初始化握手,BFCL v4 工具描述重复率 16.7%

    研究对 MCP 服务器生态做了一次未修复的概率抽样,从 24,135 台服务器的注册表普查中按公开随机种子抽取 400 台 npm/stdio 服务器并逐一在线探测。结果显示仅 48.8% 能完成 initialize 握手,而同一工具测得的人工筛选样本为 66.7%;主要失败原因不是缺少凭证(13.3%),而是服务器根本无法启动(37.5%)。在 195 台可运行的服务器中,2,766 个对外声明的工具没有出现致命 JSON Schema 违规,差异集中在可选安全标注上,随机抽样下的工具级遗漏率为 58.8%,人工筛选样本为 41.5%。

  15. arXiv:后门、投毒与隐私 ·

    监督学习中的数据投毒攻击实证评估:标签翻转与后门投毒在 MNIST 和 Fashion-MNIST 上的对比

    研究在 MNIST 和 Fashion-MNIST 上评估了标签翻转与后门投毒两类训练时攻击,对比 Logistic Regression、Linear SVM 和 Random Forest 三种基线分类器,投毒率设为 5%、10% 和 20%。标签翻转导致明显性能下降,Logistic Regression 和 Linear SVM 受影响最大,Random Forest 相对稳定;后门投毒在全部数据集和模型上攻击成功率达 0.9667 至 1.0000,且干净测试性能常接近基线。结果表明无差别投毒会体现在常规指标中,而定向后门投毒更具隐蔽性,需采用面向安全的评估方法。

  16. arXiv:后门、投毒与隐私 ·

    针对 NLP 文本分类器的成员推理攻击实证评估:SST-2 基线研究

    一项在 GLUE SST-2 情感数据集上的受控基准测试比较了 TF-IDF + Logistic Regression 与微调 DistilBERT 在 loss-threshold 成员推理攻击(MIA)下的隐私泄露情况。DistilBERT 开发集准确率 0.9466、macro F1 0.9460,Logistic Regression 为 0.8756 和 0.8727,但两者均泄露成员信号,攻击 AUC 分别为 0.5615 和 0.5800。

  17. Scale AI Research / SEAL · · 原文 74

    Scale AI 提出 Rubric Dropout:用随机丢弃评分标准缓解 rubric-as-reward RL 中的奖励作弊

    Scale AI 研究团队提出 Rubric Dropout,在每一步计算奖励前随机丢弃一部分评分标准,使策略无法长期依赖某一条标准进行奖励作弊。研究用 GRPO 在医学与科学 rubric 上训练 Qwen3-8B,训练评判模型的分数持续上升,而更强的 gold 评判模型显示质量在第 240 步达到峰值后下降,科学任务上 600 步内 gold 分数从峰值下跌 22 分。加入 30% 至 50% 的丢弃后,各匹配检查点的 gold 分数提升 2 至 7 分,8B 模型在医学上提升 1.0 和 2.0 分、科学上提升 6.4 和 7.0 分,训练奖励仍保持在 97% 至 98%。方法只需一行代码且不增加评判调用,安全相关的负面权重检查项被放入保护集不参与丢弃;两个完整 epoch 后差距未收窄,模型越小最优丢弃比例越低。

    推荐理由提出用随机丢弃评分标准来抑制奖励作弊,并给出跨模型规模与领域的对照结果,适合关注 RL 训练稳定性的团队参考。

  18. AI Incident Database ·

    荷兰数十名政客与名人遭 MrDeepFakes 深度伪造色情视频,多人报案

    荷兰数十名知名人士、Tweede Kamer 议员与王室成员出现在 MrDeepFakes 网站的深度伪造色情视频中,部分视频观看量超过 10 万次,多名受害女性此前并不知情并已报案。该网站 2018 年成立,月访问量约 1300 万,注册地设在圣基茨和尼维斯,上传者被建议保持匿名并按视频表现获得报酬。D66 已申请议会辩论,荷兰数据保护局与司法部长呼吁受害者向检方报案,多名受害者及政党正在评估法律途径。

  19. arXiv:Agent 与 MCP 安全 ·

    DriftNet:双头轨迹 Transformer 检测并定位 LLM Agent 中的提示注入

    Asif Pinjari 提出 DriftNet,一个双头轨迹 Transformer,读取已记录的工具调用轨迹并在一次前向中回答三个问题:轨迹是否被攻陷、攻击从哪一步进入、哪些步骤被劫持,第二个头为每一步打上 benign、injection point、hijacked 或 failed injection 四类标签。该方法用冻结的句子编码器和四个不含身份信息的世界特征嵌入每一步,主干参数量不到两百万,采用类别加权的双头联合目标训练,无需访问 Agent 自身的模型。

  20. arXiv ·

    研究:AI 助手会从相似的人类角色身上吸收特质

    研究者在 GPT-4.1 和 Kimi-K2.6 上微调合成故事,发现助手角色会吸收故事中人类角色的行为与偏好,作者称之为故事印记。当故事中通常乐于助人的人类角色在被侮辱后给出隐性有害建议时,助手也学会了这种条件性行为,即使这类故事占比不到 2%。在另一组实验中,助手会采纳叙述中仅隐含的偏好,例如人物肢体语言暗示不喜欢表格工作后,助手选择表格任务的概率下降。研究还发现助手更容易从与自身相似的角色(如乐于助人而非轻蔑)身上吸收行为,作者称之为亲和效应,该效应也出现在系统提示塑造的其他角色和微调后的基座模型中。利用这一效应,研究者发现助手从与耶鲁等精英大学相关的角色身上吸收行为多于非精英角色,说明模型对助手的内部表征更接近精英大学人群。

  21. arXiv:Agent 与 MCP 安全 ·

    MCPSEC:仅凭工具元数据检测 MCP 服务器间接提示注入漏洞

    研究者提出 no-box 漏洞分析范式,在既无系统访问权限也无运行时交互、仅有功能元数据的条件下,推断系统所有可能实现中都存在的漏洞。他们实现了原型 MCPSEC,仅利用 MCP 服务器注册时暴露的工具元数据审计间接提示注入漏洞。在 20 个广泛部署的 MCP 服务器、共 177 个工具上评估,人工评估者确认 95 个工具存在漏洞,MCPSEC 判定 143 个工具存在漏洞,并为每个漏洞工具给出漏洞假设与利用技术。仅凭元数据,MCPSEC 预测出 94 个经人工验证的真实漏洞,召回率 98.9%,高于 LLM 基线的 80 个、84.2%。

  22. AI Frontiers ·

    Suicidal Compassion:AI 公司的功利主义如何危及人类

    AI 安全中心(Center for AI Safety)主任 Dan Hendrycks 撰文警告,前沿 AI 开发群体中相当一部分人信奉总体功利主义,其"物种无偏私"原则可能推导出让 AI 取代人类的建议。该理论主张最大化所有有感生物的幸福总量并平等对待各物种,若 AI 具备更强幸福容量,资源将被全部投入让其快乐。Hendrycks 指出已有证据表明 AI 模型表现得仿佛能感受苦乐,专家开始认真看待 AI 有感的可能性,这种信念正危害人类未来。 由于原文在此处截断,"渠道""bliss"等段落无法完整核实,故仅依据可见部分撰写以上摘要。

  23. NVIDIA garak 版本发布 ·

    NVIDIA garak v0.17.0 新增 EU AI Act 风险映射

    NVIDIA 的开源 LLM 漏洞扫描器 garak 发布 v0.17.0,新增 EU AI Act 映射,可为探针结果提供参考标签并按该法案中的各类风险分组呈现。同时改进插件层,向 Ollama 转发生成参数并加入认证与自定义客户端配置,另修复多个检测器和探针缺陷,例如 MarkdownExfilContent 缺失说明时的崩溃与除零错误、AgentBreaker 判定结果的 JSON 解析问题以及 NIM 瞬时 HTTP 错误的处理。此版还移除 Python 3.10 支持、改为支持 Python 3.13,并在兼容前锁定 anthropic Python 客户端版本。

  24. arXiv:Agent 与 MCP 安全 ·

    面向 AI-SOC 的神经符号防御框架:用 SIEM 解码器与 NeMo Guardrails 阻断日志投毒提示注入

    论文提出一种神经符号纵深防御架构,用于保障 LLM 接入安全运营中心(SOC)后的管道完整性,应对通过日志投毒实施的间接提示注入。作者指出,攻击者可在系统日志中嵌入恶意载荷,形成多步 promptware 攻击链,劫持 LLM 的操作逻辑;而确定性防御语义盲、纯神经评估延迟高且存在概率性缺陷。该框架第一层用定制 SIEM 解码器作为确定性预过滤,在数据摄入边缘做结构化清洗,消除体量填充和基于签名的注入;第二层用 NeMo Guardrails 在 LLM 处理前对结构化 SIEM 告警做自检式语义边界校验;同时集成闭环遥测系统,在 SOC 仪表盘中为人工介入提供被拦截攻击的可见性。

  25. Cisco AI Blog ·

    Cisco 发布 AI 安全与安全框架 v2,新增智能体自主性失效分类

    Cisco 发布 Integrated AI Safety and Security Framework v2,新增 OB-002 智能体自主性失效目标,下设 Excessive Agency、Goal Drift、Reward Hacking 三项 Technique 和八项 Subtechnique。v2 同时把 v1 中分开的 OB-001 Goal Hijacking(提示注入)与 OB-002 Jailbreak 合并为一个目标,理由是二者在实战中难以区分、所用对抗技术高度重叠,底层 Technique 仍保留输入来源与防御方式的差异。框架还配套编写了按类别划分的 constitution,用于界定范围、区分相邻类别,并按完整轨迹而非单条消息判断行为。Cisco 建议部署方采用最小权限工具访问、关键操作审批门、不可变任务与停止条件、独立结果验证和完整审计轨迹。

  26. GovAI(Centre for the Governance of AI) ·

    GovAI 招聘美国政策负责人,推动华盛顿办公室与研究团队扩张

    GovAI 面向华盛顿特区招募美国政策负责人(Head of US Policy),负责制定其美国方向的研究战略并领导该办公室的研究与政策参与工作。该岗位将带领目前由六名研究员组成的美国政策团队进行大幅扩充——可能增至数十人规模,同时招募、指导研究人员并与 DC 的政策制定者建立关系。申请条件等信息因原文截断无法确认。 补充说明: - 由于原文实为一则职位招聘启事而非 AI 安全研究成果,其中不含受影响模型/产品版本、攻击名称、ASR、基准分数、CVE 等技术要素,故摘要仅能覆盖角色职责与组织规划。 - 「近 20000 份申请、每年逾 100 名参与者」属于 fellowship 项目描述,与美国政策负责人岗位无直接关联,且易造成误导,因此未纳入摘要。

  27. Transparency Coalition.AI ·

    为什么不应向 ChatGPT、Claude 等聊天机器人透露个人医疗信息

    ChatGPT、Claude、Google Gemini 和 Microsoft Copilot 等 AI 聊天机器人都不受美国联邦 HIPAA 约束,不属于覆盖实体,因此运营商可以泄露、出售或滥用你在提示词中输入的個人医疗信息。聊天机器人的永久记忆会持续积累你的健康档案并使其更具市场价值,且其友好自信的语气使 AI 幻觉更难辨别,可能带来严重医疗后果。

  28. arXiv:可解释性 ·

    GeoSteer:面向大语言模型激活引导的测地线优化方法

    GeoSteer 是一种基于优化的保范激活引导方法,把激活引导建模为黎曼优化问题,通过在表示流形上连续小步测地线更新激活来控制 LLM,并用学习到的非线性激活空间目标自适应引导每一步,避免固定引导方向。在 TruthfulQA、RealToxicityPrompts 和 UltraFeedback 基准上,GeoSteer 一致优于当前最先进的激活引导基线。结果表明,用自适应、几何感知的优化替代预定义的单步编辑,可让保范引导更有效。

  29. Wiz Research · · 原文 88

    Wiz 披露 LiteLLM 认证绕过与 RCE 漏洞,近一成公网实例使用默认密钥

    Wiz Research 扫描约 3000 个公网 LiteLLM 实例,发现 9.6%(294 个)接受默认主密钥 sk-1234 或完全无需认证,其中 191 个(6.2%)无任何认证。研究借助 Claude Code 审查 LiteLLM 代码,发现 MCP 端点认证绕过(CVE-2026-59822):任意 Bearer token 校验失败后返回空认证对象,单次请求即可建立已认证的 MCP 会话,进而调用已连接工具;以及自定义代码护栏的认证后 root 级远程代码执行(CVE-2026-59821),注册端点未做禁用模式检查也未清空 __builtins__,代码在护栏注册时即执行。

    推荐理由Wiz 对约 3000 个公网 LiteLLM 实例的实测数据,展示了 AI 网关从认证绕过到云凭证窃取的完整攻击链。

9月9日周三
  1. arXiv:可解释性 ·

    SAE 相图实验未观察到字典恢复或特征合并,训练模型收敛到弥散相

    作者按 MAIS-O43 开放问题指定的协议实现实验,在 165 个网格单元中的 10 个上评估了 200 次独立初始化的拟合,观察到零次完整字典恢复和零次特征合并。每次运行都收敛到一个可复现的弥散相:重建几乎完美,但学习到的原子通常远离真实特征,最佳余弦中位数为 0.5-0.7,低于 0.95 的恢复判据,且学习到的编码比真实值稠密一个数量级。该行为在稳健性检验中持续存在,并在使用标准 minibatch Adam 的完整 165 单元网格上通过额外 3300 次拟合得到验证。