全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 8 条- 动态Meta AI Research
Meta 如何为 Muse 构建安全机制
Meta 披露 Muse 的安全设计:通过运行时隔离、凭据保护、独立授权网关、外传审批与支付确认等防御,按"智能体可能已被攻破"的限损思路构建。该架构为厂商自述而非独立审计保证,且不阻止 Meta 在必要时访问数据,Confidential VM 仍属后续计划。
- 论文arXiv:可解释性
针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估
研究提出一个 2×2 纵深防御框架,将内部激活引导与外部记忆处理分离,在 MemSyco-Bench 上评估四种开放权重模型,涉及 10 个引导系数和五种记忆防御配置。其中三种配置为新设计:重写全部记忆、对每条记忆保留/重写/丢弃的 Router Gate,以及丢弃全部记忆。在 Llama 3.1 8B 上,Router Gate 配合轻度反向引导(α = -1.5)将评委平均谄媚率从 35.80% 降至 31.32%,平均准确率从 43.99% 变为 43.31%,但该下降在 149 个样本上不具统计显著性(配对 p = 0.08 至 0.63)。
- 论文arXiv
RMCW:基于 Reed-Muller 码的抗删除 LLM 水印方法
研究者提出 RMCW,一种基于 Reed-Muller 码的大语言模型水印方法,用于应对删除攻击导致的 token 位置偏移和水印对齐失效。生成阶段通过密钥化的词表划分把 Reed-Muller 结构注入文本序列;检测阶段将文本映射到密钥词表分箱,并用 Berlekamp-Welch 检验测试局部子序列的低次 Reed-Solomon 一致性,从而寻找存活的局部代数结构而非恢复全局码字。在 C4 和 ELI5 数据集、OPT-1.3B 与 Llama-3.1-8B-Instruct 上的实验显示,RMCW 保持较强的干净文本可检测性,并在多种删除与改写攻击下优于或持平基线方法。代码已开源于 https://github.com/BaichengDanny/RMCW。
- 动态The Verge AI
Apple 将限制 Mac 完全磁盘访问,称 AI 智能体大幅提升风险
Apple 宣布将在 macOS 上为完全磁盘访问权限增加新的限制,要求用户通过非常明确的主动操作才能授予应用这一权限。Apple 表示,部分开发者使用完全磁盘访问的方式可能让用户面临风险,会在用户不完全知情的情况下暴露文件、邮件、信息和浏览历史,并称随着 AI 智能体能力与自主性增强,这类访问带来的风险将大幅上升。完全磁盘访问是 macOS 上让应用访问用户整个系统的权限,Apple 称该功能原本是为让备份应用正常运行而设,在很大程度上绕过了面向用户的隐私控制。Apple 未说明该更新的推出时间。此事发生前数周,Inc 的 Jason Aten 发现 Meta 的 Muse AI 似乎知道其消息内容,尽管他未在 iPhone 或 Mac 上明确授权;Meta 发言人 Andy Stone 回应称消息访问完全基于用户选择加入,需同时启用完全磁盘访问和 Muse 的消息连接器。
- 动态X @_Sizhe_Chen_
Meta-SecAlign-70B 通过博士资格答辩
通过了我的博士资格答辩(论文开题)!特别感谢导师 David Wagner 和 Chuan Guo 在过去两年的大力支持。我们的 Meta-SecAlign-70B 在提示注入安全性和智能体(工具/网页)实用性上与 GPT-5(high)相当。3 个月内下载量达 1 万次!
- 论文arXiv
Llama 3 模型群:405B 稠密 Transformer 与 Llama Guard 3 安全模型
Meta 发布 Llama 3 模型群,最大模型为 405B 参数的稠密 Transformer,上下文窗口最高 128K tokens,原生支持多语言、编程、推理与工具使用。评测显示其在大量任务上质量与 GPT-4 相当,并公开释出 405B 的预训练与后训练版本及输入输出安全模型 Llama Guard 3。论文还通过组合式方法将图像、视频和语音能力接入 Llama 3,在识别任务上表现与 SOTA 相当,但这些多模态模型仍在开发中,尚未广泛发布。
- 论文arXiv:对齐、欺骗与监督
Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现
Odin 是首个开源的端到端 GPU CKKS 实现,可在加密状态下完成 Llama-3-8B 推理。它通过 feature-major 跨层布局统一残差连接与层接口,并为线性投影和注意力构建临时算子内布局,减少权重的冗余明文编码;注意力中 QK^T 的分数可直接被 Softmax 消费,PV 直接消费概率,避免中间重打包;非线性运算采用带输入范围控制的 minimax 多项式近似与联合误差分配。在单张 NVIDIA H100 80 GB GPU 上,输入 128 token 时评估全部 32 层耗时 366.4 s、峰值显存 58.9 GiB,相比 THOR 的 1651.9 s 提速 4.51 倍。
- 论文arXiv
WIFA:按意图分组监督缓解包装式越狱与过度拒答
论文提出 Wrapper-Based Intent-Form Augmentation(WIFA),一种自动意图分组增强方法,把带包装的有害示例与结构匹配的带包装良性反例配对,无需外部教师模型或逐包装的人工意图标注。WIFA 作为通用数据层支持两条微调路线:两阶段高安全配方 WIFA-Boost,以及 Anchored Group-Consistent Refusal Training(A-GCRT),后者在同一意图的不同包装间正则化拒答与合规决策分数,并把有害与良性分组锚定在间隔两侧。