跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 8 条 · 共 8 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 2
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源602新闻与研究603细分与主体7来源:Meta AI ResearchMeta AI Research1 条材料来源:arXiv:可解释性arXiv:可解释性1 条材料来源:arXivarXiv1 条材料来源:The Verge AIThe Verge AI1 条材料来源:X @_Sizhe_Chen_X @_Sizhe_Chen_1 条材料来源:arXivarXiv1 条材料动态:Meta 如何为 Muse 构建安全机制动态2026-09-08Meta 如何为 Muse 构建安全机制论文:针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估论文针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估论文:RMCW:基于 Reed-Muller 码的抗删除 LLM 水印方法论文2026-10-05RMCW:基于 Reed-Muller 码的抗删除 LLM水印方法动态:Apple 将限制 Mac 完全磁盘访问,称 AI 智能体大幅提升风险动态2026-10-02Apple 将限制 Mac 完全磁盘访问,称 AI智能体大幅提升风险动态:Meta-SecAlign-70B 通过博士资格答辩动态2025-10-10Meta-SecAlign-70B 通过博士资格答辩论文:Llama 3 模型群:405B 稠密 Transformer 与 Llama Guard 3 安全模型论文2024-07-31Llama 3 模型群:405B 稠密Transformer 与 Llama Guard 3 安全…方向:Agent 安全Agent 安全4方向:防御与护栏防御与护栏5方向:MetaMeta6方向:政策与监管政策与监管1方向:开源模型安全开源模型安全2方向:其他方向其他方向2方向:OpenAIOpenAI1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。3 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 8 条
  • 动态Meta AI Research

    Meta 如何为 Muse 构建安全机制

    Meta 披露 Muse 的安全设计:通过运行时隔离、凭据保护、独立授权网关、外传审批与支付确认等防御,按"智能体可能已被攻破"的限损思路构建。该架构为厂商自述而非独立审计保证,且不阻止 Meta 在必要时访问数据,Confidential VM 仍属后续计划。

  • 论文arXiv:可解释性

    针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估

    研究提出一个 2×2 纵深防御框架,将内部激活引导与外部记忆处理分离,在 MemSyco-Bench 上评估四种开放权重模型,涉及 10 个引导系数和五种记忆防御配置。其中三种配置为新设计:重写全部记忆、对每条记忆保留/重写/丢弃的 Router Gate,以及丢弃全部记忆。在 Llama 3.1 8B 上,Router Gate 配合轻度反向引导(α = -1.5)将评委平均谄媚率从 35.80% 降至 31.32%,平均准确率从 43.99% 变为 43.31%,但该下降在 149 个样本上不具统计显著性(配对 p = 0.08 至 0.63)。

  • 论文arXiv

    RMCW:基于 Reed-Muller 码的抗删除 LLM 水印方法

    研究者提出 RMCW,一种基于 Reed-Muller 码的大语言模型水印方法,用于应对删除攻击导致的 token 位置偏移和水印对齐失效。生成阶段通过密钥化的词表划分把 Reed-Muller 结构注入文本序列;检测阶段将文本映射到密钥词表分箱,并用 Berlekamp-Welch 检验测试局部子序列的低次 Reed-Solomon 一致性,从而寻找存活的局部代数结构而非恢复全局码字。在 C4 和 ELI5 数据集、OPT-1.3B 与 Llama-3.1-8B-Instruct 上的实验显示,RMCW 保持较强的干净文本可检测性,并在多种删除与改写攻击下优于或持平基线方法。代码已开源于 https://github.com/BaichengDanny/RMCW。

  • 动态The Verge AI

    Apple 将限制 Mac 完全磁盘访问,称 AI 智能体大幅提升风险

    Apple 宣布将在 macOS 上为完全磁盘访问权限增加新的限制,要求用户通过非常明确的主动操作才能授予应用这一权限。Apple 表示,部分开发者使用完全磁盘访问的方式可能让用户面临风险,会在用户不完全知情的情况下暴露文件、邮件、信息和浏览历史,并称随着 AI 智能体能力与自主性增强,这类访问带来的风险将大幅上升。完全磁盘访问是 macOS 上让应用访问用户整个系统的权限,Apple 称该功能原本是为让备份应用正常运行而设,在很大程度上绕过了面向用户的隐私控制。Apple 未说明该更新的推出时间。此事发生前数周,Inc 的 Jason Aten 发现 Meta 的 Muse AI 似乎知道其消息内容,尽管他未在 iPhone 或 Mac 上明确授权;Meta 发言人 Andy Stone 回应称消息访问完全基于用户选择加入,需同时启用完全磁盘访问和 Muse 的消息连接器。

  • 动态X @_Sizhe_Chen_

    Meta-SecAlign-70B 通过博士资格答辩

    通过了我的博士资格答辩(论文开题)!特别感谢导师 David Wagner 和 Chuan Guo 在过去两年的大力支持。我们的 Meta-SecAlign-70B 在提示注入安全性和智能体(工具/网页)实用性上与 GPT-5(high)相当。3 个月内下载量达 1 万次!

  • 论文arXiv

    Llama 3 模型群:405B 稠密 Transformer 与 Llama Guard 3 安全模型

    Meta 发布 Llama 3 模型群,最大模型为 405B 参数的稠密 Transformer,上下文窗口最高 128K tokens,原生支持多语言、编程、推理与工具使用。评测显示其在大量任务上质量与 GPT-4 相当,并公开释出 405B 的预训练与后训练版本及输入输出安全模型 Llama Guard 3。论文还通过组合式方法将图像、视频和语音能力接入 Llama 3,在识别任务上表现与 SOTA 相当,但这些多模态模型仍在开发中,尚未广泛发布。

  • 论文arXiv:对齐、欺骗与监督

    Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现

    Odin 是首个开源的端到端 GPU CKKS 实现,可在加密状态下完成 Llama-3-8B 推理。它通过 feature-major 跨层布局统一残差连接与层接口,并为线性投影和注意力构建临时算子内布局,减少权重的冗余明文编码;注意力中 QK^T 的分数可直接被 Softmax 消费,PV 直接消费概率,避免中间重打包;非线性运算采用带输入范围控制的 minimax 多项式近似与联合误差分配。在单张 NVIDIA H100 80 GB GPU 上,输入 128 token 时评估全部 32 层耗时 366.4 s、峰值显存 58.9 GiB,相比 THOR 的 1651.9 s 提速 4.51 倍。

  • 论文arXiv

    WIFA:按意图分组监督缓解包装式越狱与过度拒答

    论文提出 Wrapper-Based Intent-Form Augmentation(WIFA),一种自动意图分组增强方法,把带包装的有害示例与结构匹配的带包装良性反例配对,无需外部教师模型或逐包装的人工意图标注。WIFA 作为通用数据层支持两条微调路线:两阶段高安全配方 WIFA-Boost,以及 Anchored Group-Consistent Refusal Training(A-GCRT),后者在同一意图的不同包装间正则化拒答与合规决策分数,并把有害与良性分组锚定在间隔两侧。