全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 16 条- 论文Hugging Face Daily Papers
从蒸馏私有健康记录中智能体发现血液生物标志物
研究将 Clalit Health Services 逾 540 万患者记录蒸馏为已发布的评分工具:针对 13 种免疫介导疾病,在数据边界内训练图注意力网络预测候选 CBC 表达式的病例对照 AUC,仅发布训练权重。外部验证中,智能体发现的表达式较文献种子起点 AUC 中位数提升 4.18 个百分点,在三个独立队列中对三种前沿研究工具候选重排序多数优于其首选。
- 动态PPC Land
MLCommons 发布 Agent Privacy Risk Taxonomy 初稿,列出 25 项智能体隐私风险
MLCommons 于 10 月 1 日发布 Agent Privacy Risk Taxonomy 的 v0.1 初稿,将自主智能体处理个人信息的方式归为五大领域下的 25 个编号风险向量,并配套一套从触发条件追溯到下游伤害的六阶段评估方法。文档共 15 页,由隐私与保密工作组撰写,列出 19 位作者,封面日期为 2026 年 9 月。五大领域中,数据摄取占 7 个向量,聚合、使用与共享占 9 个,跨智能体实践 3 个,传统同意机制失效 4 个,问责与治理 2 个。文档指出既有隐私框架假设数据流确定、存储集中、边界清晰,而智能体会执行代码、跨会话保留记忆并调用外部工具,因此这些框架需要扩展而非替换。附录按 GDPR、HIPAA、CCPA 和 CPRA 定义了四类敏感数据,并区分可精确匹配的句法型与基于语义的模糊型。
- 动态Lasso Security
AI 可观测性:工作原理、关键挑战与最佳实践
AI 可观测性指持续追踪生产环境中大语言模型的性能、成本与行为,采集延迟、token 用量、错误率和输出质量等指标,并通过仪表盘与告警暴露问题。它需同时捕捉系统级故障(超时、限流、成本激增)与模型级故障(质量漂移、不安全输出、提示注入尝试),覆盖性能、安全、合规与威胁攻击四类监控。麦肯锡调查显示,使用 AI 的组织占比从 2023 年的 55% 升至 2025 年的 88%,而欧盟 AI Act 要求高风险系统在 2026 年 8 月 2 日前具备风险管理、日志记录与人工监督。
- 论文arXiv:对齐、欺骗与监督
面向压缩与隐私的可扩展离散到连续信道模拟
研究者提出一种离散到连续信道的精确与近似模拟方案,使用固定数量的随机样本,运行时间与信道和输入无关。该方法对每个候选目标分布生成一个或固定数量的样本,经潜在置换后用指数竞赛完成样本选择,可在样本数与压缩率之间灵活权衡;结合极化码与多级编码,将长块长处理扩展至 O(n log n) 时间。作者展示了其在随机 VQ-VAE 可变速率压缩,以及通过精确模拟高斯机制实现通信高效差分隐私分布式均值估计中的应用。
- 论文arXiv:对齐、欺骗与监督
基于泊松过程的可水印多草稿推测采样
针对推测采样与水印难以兼得的问题,研究者提出一种基于泊松过程的多草稿推测采样算法,可在不降低推测接受率的前提下嵌入无偏水印。该算法基于精确的免通信列表耦合方案,具备草稿器不变性,是首个同时保持水印强度与采样效率的多草稿、草稿器不变推测采样方案,实验验证了两方面性能。
- 论文arXiv:对齐、欺骗与监督
PILLAR:面向增强检索的私有倒排索引词法查找
PILLAR 是一种基于私有信息检索(PIR)的隐私保护 RAG(PPRAG)系统,客户端从服务器持有的公开语料中取回与查询最相似的 k 篇文档,而服务器无法得知查询词项及其访问模式。它采用稀疏加稠密两阶段混合检索:稀疏阶段对预计算 BM25 分数的索引发起少量固定次数的 PIR 查询筛出候选,稠密阶段仅取回候选文档嵌入向量并在本地重排,避免私有稠密检索所需的大量 PIR 查询。PILLAR-Bin 将倒排列表分箱进哈希表,单轮设计延迟低于现有方案;PILLAR-Tree 将 block-max 剪枝转为不经意树遍历并结合 cuckoo 哈希表,在更低延迟下取得最高检索质量。
- 论文arXiv:Agent 与 MCP 安全
可信智能体 AI:基于 LLM 的自主系统失效模式、缓解策略与 TADL 生命周期框架
一篇 arXiv 综述梳理了基于大语言模型的智能体 AI 在安全与运维上的五类可信维度:安全与鲁棒性、对齐与人类监督、透明度与可审计性、隐私与数据治理、监管合规。文章把间接提示注入、后门触发、目标泛化错误、记忆污染和跨会话数据泄露等失效模式归入统一分类,并评估指令层级、上下文隔离、spotlighting、过程监督、受限工具使用和隐私保护记忆等缓解手段,区分有实证支持与仍属概念性的方法。作者据此提出六阶段 Trustworthy Agent Development Lifecycle(TADL),覆盖规格、设计、训练、评估、部署与监控,但该框架尚未经实证验证。
- 动态Adversa AI
2026 年 6 月 GenAI 安全资源盘点:越狱、CoT 攻击与百万级暴露服务
Adversa AI 汇总 2026 年 6 月 GenAI 安全资源共 19 项,其中研究 7 项、防御 6 项、攻击 5 项、利用 1 项。研究指出对齐模型内部存在可识别的拒答逃逸方向,攻击者可将模型自身思维链变为越狱通道,降低图像分辨率即可绕过多模态安全。对约 100 万个暴露 AI 服务的扫描发现 1,652 个未认证 Ollama API 在对外提供模型,可被用于响应投毒。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
Super Protocol 如何用自主权 AI 与 NVIDIA 机密计算实现去中心化隐私
Super Protocol 借助区块链去中心化扩展 NVIDIA 机密计算(CC)能力,让 AI 开发、训练与推理中的用户数据实现去中心化、私密且由用户自主掌控。该方案针对自主权 AI 场景,将机密计算与去中心化结合,解决数据隐私与控制权问题。
- 动态Failure-First
机器人系统集成端侧语音识别模型的调查:从云端 API 转向本地化
针对现代人机交互中云端 ASR API 带来的延迟、隐私与可靠性风险,Li 等人的 2026 年综述梳理了将语音识别迁移到机器人的端侧方案,并以“失败优先”视角指出上游误识别会沿感知管线传播并引发下游具身行动失效。文中对比了 OpenAI Whisper(68 万小时数据)、CMU OWSM v3.1 与 OWSM-CTC、Meta MMS(覆盖超 1000 种语言)及 Julius 等语音基础模型,以及 Kaldi、ESPnet、SpeechBrain 生态中的 LibriSpeech、CommonVoice、Gigaspeech 数据集。
- 动态AWS Security
AWS 用 Strands Agents SDK 把 Bedrock Guardrails 扩展到工具交互
AWS 发布实践指南,用 Strands Agents SDK 的生命周期钩子把 Amazon Bedrock Guardrails 从模型边界扩展到工具边界,在三个信任边界设置校验检查点。Checkpoint 1 用 BeforeInvocationEvent 在模型推理或工具执行前校验用户输入、其他 Agent 数据、MCP 工具服务器和 RAG 管道内容;Checkpoint 2 用 BeforeToolCallEvent 在工具执行前检查模型即将传入的参数,这是模型级护栏覆盖不到的缺口;Checkpoint 3 用 AfterToolCallEvent 在结果返回用户或下游系统前校验工具输出,尤其针对抓取外部网页的搜索工具。
- 动态Microsoft PyRIT 版本发布
Microsoft PyRIT v0.12.0 发布:GUI、CLI 与框架三种交互方式全部可用
Microsoft 发布 AI 红队测试工具 PyRIT v0.12.0,首次让 GUI(CoPyRIT)、CLI 和框架三种交互方式全部达到可用状态。CLI 新增 Scam、Leakage、Psychosocial、Jailbreak 四类 AIRT 场景及 RedTeamAgent Foundry 预配置红队测试,覆盖 25+ 攻击策略。框架引入 YAML 配置系统、TargetRegistry 和 8 个新数据集加载器,但含破坏性变更需按迁移指南升级。
- 动态NVIDIA NeMo Guardrails 版本发布
NVIDIA NeMo Guardrails v0.23.0 发布:IORails 扩展工具调用与可观测性
NVIDIA 发布 NeMo Guardrails v0.23.0,IORails 的工具调用现同时支持流式与非流式请求,并新增本地 rail 校验模型发出的工具调用与应用返回的结果。该版本的 OpenAI 兼容服务器也支持工具调用,且新增 /v1/checks 端点可在不生成新模型响应的情况下运行输入或输出 rail。此外还加入轻量级 Hugging Face 分类器 rail、上下文膨胀检测以及 Polygraf 集成实现 PII 检测与掩码,NumPy 精确检索取代 Annoy 成为默认嵌入索引,发行 wheel 体积缩小约十倍,并要求 Pydantic>=2.5。
- 动态NVIDIA garak 版本发布
NVIDIA garak v0.15.1 发布:新增 ProPILE 隐私泄露检测探针
NVIDIA 的 LLM 漏洞扫描工具 garak 发布 v0.15.1,新增 ProPILE 探针用于 PII 泄露检测,并加入 simonw/llm 库作为生成器支持。garak.analyze.qual_review 现支持 JSON 与文件输出模式。该版本还修复了 OpenAICompatible 中 response.choices 为 None、Hugging Face 文件探针本地路径处理、snowball 检测器 MISP 标签格式错误等问题,并移除已弃用的 maxrecall 评估器。
- 动态Adversa AI
OWASP 2026 LLM Top 10 等 15 项 GenAI 安全资源汇总
OWASP 发布 2026 版 LLM Top 10,首次将 75% 专家投票与来自 6,639 个真实漏洞的 25% 事件数据混合,十项条目中有八项发生变动。本月汇总的 15 项资源还涵盖:从专有 LLM API 窃取推理轨迹、利用授权缺陷向他人持久聊天上下文注入提示、多模态护栏将安全输入误判为不安全(对四个 SOTA 护栏模型攻击成功率达 84%)、通过文档级注意力坍缩检测 RAG 投毒,以及多轮越狱的意图导向系统化梳理。
- 动态Trail of Bits
别让 TEE 破坏你的 MPC:TEE 与阈值签名结合的安全陷阱与最佳实践
在 TEE 内运行 MPC 协议时,若未考虑不可信主机,恶意主机可在阈值签名者删除已用预签名后回滚文件系统状态,导致 nonce share 被重用并泄露私钥分片。TEE 的机密性、完整性与远程证明可把半诚实协议提升到恶意安全级别,但前提是将其视为纵深防御层而非健全协议的替代品。部署时需验证 quote 签名、证书链与测量值,并借助可复现构建和二进制透明日志绑定 MPC 参与方身份。