全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 21 条- 动态Law Society Gazette
聊天机器人推荐被 SRA 罚款或关闭的律所
Blind Justice UK 的小规模测试称,聊天机器人会推荐受 SRA 罚款或已关闭的律所。该组织还讨论了让纪律处分记录更便于机器读取及加强核验的建议。上述结果来自该组织报告,并非独立复现,也不能视为已造成损害的证据。
- 论文论文追踪
综述:100项研究显示青少年AI风险防护多停留在设想阶段
一项系统综述梳理了100项涉及儿童与青少年接触AI的实证HCI研究,覆盖学校、家庭、照护机构和公共服务等场景。研究使用YAIR风险分类和MIT Mitigation Taxonomy对策分类,对风险与防护措施进行映射,发现多数风险只对应提出或设想中的对策,已实施的对策很少,经过评估的更少,且现有评估多衡量技术性能而非是否真正防止了伤害。作者据此指出风险覆盖的空白区域和未经检验的防护措施,并提出HCI研究加强青少年AI安全的具体方向。
- 动态AgentPrivArena project
AgentPrivArena 发布 Agent 隐私评测基准与运行时审计框架
AgentPrivArena 用真实 MCP 工具和本地服务评测智能体隐私,区分敏感信息进入上下文与最终对外泄露。作者实验中,情境完整性审计将平均输出泄露率从46.8%降至17.8%,但敏感信息进入上下文的比例仍约74%至78%;因此减少输出泄露不等于避免不必要读取。结果来自特定模型和任务设置,未经独立复现,信息流提取不完整也是机制限制。
- 论文论文追踪
研究评测训练数据提取风险的跨语言迁移
作者评估英语为中心和多语言模型的个人信息保护,发现原本在英语条件下观察到的训练数据泄露可在部分其他语言条件下重现,迁移程度与所测模型的多语言能力相关。作者还观察到措辞变化会显著影响结果。结论限于论文所测模型、数据与语言,不代表所有个人信息都可跨语言提取。
- 动态Agora Digitale Transformation
Agora 审计欧盟 27 国议员遭深度伪造色情暴露情况
Agora Digitale Transformation 的早期研究考察欧盟各国议员受到性化深伪内容影响的情况。机构报告称,在研究涉及的 5,872 名各国议员中,147 人被相关内容描绘或关联,其中 138 人为女性、9 人为男性。这与后续针对欧洲议会议员的 50 人统计属于不同研究群体。
- 论文论文追踪
AgentPrivArena:面向 LLM Agent 工作流的隐私风险评测框架
研究者提出 AgentPrivArena,一个在可复现执行环境中评测 LLM Agent 隐私风险的框架,集成了真实的 MCP 工具与自托管服务。该框架提出轨迹级隐私指标,量化最终回复之外的不必要信息访问,并给出运行时审计方法 AgentPrivAudit,用于在 Agent 执行过程中监控隐私违规。在多个前沿 LLM Agent 上的实验显示,现有评测范式忽略了大量隐私风险,作者据此强调轨迹级审计对可信 Agent 部署的重要性。
- 论文Hugging Face Daily Papers
MBZUAI 提出可校准的真实图像认证方法,20 个深伪检测器在对抗扰动下全部跌破 2% 准确率
MBZUAI 团队提出一种基于重建保真度的可校准认证方法,只在没有任何已知生成器能忠实重建样本时才将其认证为真实,否则弃权并给出重建证据。研究评估了 20 个深伪检测器对 10 个生成器的表现,最佳准确率从 2022 年生成器上的 99.5% 降至 2026 年生成器上的 76%;在 ϵ=8/255 的 ℓ∞ 有界扰动下,20 个检测器全部跌破 2% 准确率,最强的 D3 也只剩 1.75%。该方法在 1% 误报率下校准安全阈值与更严格的安全(security)阈值,SD3 Medium 的阈值从 0.0365 提升到 0.038 后仍保持该上界;best-of-100 攻击加 PGD 只把候选分数从 0.0148 提到 0.0154,24 种语义变换中 23 种低于安全阈值。
- 论文论文追踪
OLMo-Detect:面向 LLM 成员推断的多阶段混淆控制基准
研究者提出 OLMo-Detect,一个基于完全开放的 OLMo 2 流程构建的多阶段、混淆控制成员推断基准,覆盖预训练、中期训练和后训练,并在三个关键维度上对齐成员与非成员,同时用 infini-gram 严格过滤非成员。研究还引入成员与非成员错位的 OLMo-Detect(Shifted)变体以评估分布偏移下的鲁棒性,并在 OLMo 2 系列上评测了 15 种无监督和 3 种有监督成员推断攻击。结果显示:最佳无监督与有监督攻击的 AUC 均仅为 0.68,有监督攻击在跨域评测中性能下降;攻击性能在中期训练阶段最高,这一模式由数据类型而非阶段效应驱动,人工整理的数学数据远比其他类型更易被检测;整体分数从 1B 到 13B 提升但在 32B 趋于平台;没有无监督攻击能抵御分布偏移,AUC 变化幅度最高达 0.42。研究称这些结论可推广到 OLMo 3 和非 OLMo 模型。
- 论文论文追踪
CorrectGuard 提出黑盒安全护栏的免查看正确性估计框架
研究者提出 CorrectGuard,一个面向黑盒安全护栏的免查看正确性估计框架,用于在人类不可查看用户输入和机器不可查看输入两种场景下评估护栏表现。该方法仅使用有标注的可查看数据训练独立的模型评估器,预测护栏对不可访问输入的判定是否正确,无需接触护栏内部。研究在涵盖有害内容、越狱、提示注入和提取的 13 个安全数据集上,以留一数据集方式评估上下文学习、嵌入向量和微调三类正确性模型,并将开源权重护栏统一视为黑盒。结果显示,基于上下文学习的正确性分类器在两种场景下均显著提升错误识别能力,宏观准确率最高提升 25 个百分点,基于微调的方法提升近 15 个百分点,但不同护栏和留出数据集之间差异明显。
- 论文论文追踪
范围综述梳理 LLM 聊天机器人对心理健康的 119 篇相关文献
一篇发表于 npj Digital Medicine 的范围综述系统梳理了 119 篇关于 LLM 聊天机器人(LLM-CB)心理健康危害的文献,将其归纳为概念性工作、心理健康支持使用、认知过度依赖、AI 依赖和 AI 精神病五类主题。综述指出,概念性文献共列出 22 种潜在危害,涵盖幻觉、谄媚、偏见、数据隐私、缺乏监管等,但多数仍属推测,实际影响程度不明。在心理健康支持使用类研究中,18/29 为情境/基准研究,显示 LLM-CB 在高风险情境下可能给出不恰当或有害回应,但用户实际受影响程度尚未量化。认知过度依赖类研究(15 篇)发现频繁使用与认知和学业表现下降相关,其中 3 项实验研究提示因果关系,但对批判性思维的影响结论不一致。综述还提到 OpenAI 2025 年自报数据估计超过百万 ChatGPT 用户(约 0.15%)表现出严重心理困扰迹象,该数据基于内部分类器、未经独立验证。
- 论文论文追踪
aiXamine:跨维度评测 LLM 安全、安全(security)与隐私权衡
研究者提出 aiXamine,一个统一黑盒评测平台,把 LLM 的安全、安全(security)与隐私当作相互依赖的属性来评估。平台通过自动化红队流程编排 9 项服务上的 46 个测试,生成从提示词级诊断到跨服务权衡分析的分层风险画像,可在相同条件下复现对比闭源与开源权重系统。作者用 aiXamine 测试了 120 多个 LLM、超过 5000 次测试运行,发现三种单轴评测看不到的跨维度现象:更强的对齐会系统性提高过度拒答,形成可量化的安全税;隐私与其他可信维度近乎正交,标准对齐无法覆盖;无 on-policy 校正的 off-policy 知识蒸馏会导致熵坍缩,在同一基础架构上把鲁棒性从 56.9 降到 2.6。
- 论文论文追踪
研究者提出可提取记忆的匹配比较检验方法
A. Feder Cooper、Percy Liang 等研究者提出用匹配比较来判定语言模型的可提取记忆,即同时测量训练序列与可比非训练序列的生成概率,以非训练序列的概率作为可预测性基线,超过基线才算记忆证据。方法包含两种形式:在序列从总体抽样时使用按选定假阳性率校准的 conformal 检验,以及针对单文档、以匹配的非训练文档校准的普查。在 Wikipedia 上,OLMo 2 32B 复现非训练 10-token 后缀的频率约为训练后缀的 24%,这部分反映的是假阳性而非记忆;在书籍数据上,Llama 3.1 70B 的校准普查阈值低至 10^(-27),可为任何可行采样预算都难以提取的序列提供记忆证据。作者据此把可提取记忆重新定义为同时满足有效记忆主张与在现实预算内近乎确定生成。
- 论文论文追踪
ALeBi:用 bias probe 主动审计多群体公平性
研究者提出 bias probe 框架与主动审计器 ALeBi,通过定向自适应查询估计多群体公平性指标,无需重建黑盒模型即可揭示偏差结构。该工作给出由属性特定复杂度度量控制的样本复杂度保证,并扩展到模型所有者刻意隐藏偏差的对抗场景,揭示模型保密性与可靠审计之间的根本权衡。实验验证了理论结果,并表明该方法能准确估计偏差、可解释地识别高偏差与低偏差区域。
- 论文论文追踪
研究分析 Be My Eyes 1428 条低分评论,揭示视觉描述服务的骚扰、隐私与无障碍安全问题
Brigham 与 Kohno 对 Be My Eyes 的 1428 条一至三星评论做定性分析,考察这一连接超百万盲人与低视力用户、超千万志愿者的视觉描述服务及其 AI 版本 Be My AI 中用户和志愿者遇到的问题。分析发现三类问题:网络骚扰与滥用(恶意骚扰、网络裸露、举报机制失效)、信息暴露之外的隐私担忧(数据被用于模型训练),以及无障碍与安全问题(描述不准确、家长式护栏)。研究还分析平台政策是否及如何回应这些问题,并针对无障碍、安全、隐私与 AI 方面的挑战提出改进视觉描述服务信任与安全的建议。
- 论文论文追踪
AntiSkillBench:评测 persona skill 的隐私泄露与行为模仿风险
研究者提出 AntiSkillBench,一个覆盖 persona skill 全流程的端到端基准,用于评测隐私泄露、属性披露与行为模仿风险及相应防御。该基准包含 7,500 条 persona 对话轨迹,来自 50 个行为特征丰富的用户画像,覆盖多种任务场景;评测套件在三种 skill 蒸馏策略下测量 skill 级隐私泄露与 agent 级属性披露、行为模仿;防御评测覆盖在线与事后干预的四种配置,包括主动风险抑制与被动来源保护。在三个前沿 agent 上的实验显示,persona skill 的风险跨 agent 骨干与蒸馏协议持续存在,并从显式属性延伸到沟通风格与人格特质;现有防御效果有限且依赖蒸馏方式,难以跨风险类型与蒸馏策略泛化。作者认为该基准为开发隐私保护与真实性感知的 persona skill 提供了有挑战性的评测工具。
- 论文论文追踪
CoSec:面向社区场景的 LLM Agent 安全基准
研究者提出 CoSec,一个用于评估 LLM Agent 系统在社区内部及跨社区运行时隐私与授权执行情况的可执行基准。该基准包含 208 个规范场景,覆盖固定与演化的社区边界、属于 Agent 所有者或其他参与者的受保护信息,以及通过对话、环境内容、持久记忆和组合工作流发起的攻击。CoSec 以持久会话、记忆、文件和工具运行完整 Agent 系统,并借助执行轨迹与产物对照当前授权状态验证信息流。结果显示,在不同 harness 与模型配置下,Agent 常能完成正常任务,却违反隐私与授权边界;隐私行为随 harness、攻击面和社区状态而变化,说明记忆、文件、工具与工作流都可能把受保护信息带出授权范围。作者据此指出,任务效用并不代表隐私或授权合规,社区场景下的授权仍是持久化 LLM Agent 尚未解决的安全挑战。
- 动态MLCommons(安全评测相关)
MLCommons 联合 Google DeepMind 完成首个闭源模型双重盲测概念验证
MLCommons 与 Google DeepMind、OpenMined、AVERI 合作完成了全球首个针对闭源模型的双重盲评概念验证,通过密码学保证在不暴露双方资产的前提下运行评测。该方案由 AVERI 借助 OpenMined 的安全计算执行,在一个容器化的 Google DeepMind 模型中运行来自 AILuminate 安全基准预留子集的提示词,确保被测模型此前从未接触过这批题目。此举使开发者看不到测试数据、仪器方(MLCommons)与审计方(AVERI)也拿不到模型的权重,从而避免污染基准并维持其完整性。
- 论文arXiv:后门、投毒与隐私
论文揭示 BatchNorm 架构下机器遗忘评测的归一化伪影
论文发现基于 BatchNorm 架构的机器遗忘评测存在一个此前未被记录的混杂因素:对保留数据做一次前向传播、不修改任何权重,就能确定性地改写模型的归一化状态,并逆转表面指标上的遗忘效果。作者将该操作形式化为保权重的固定点算子,并证明其造成的遗忘前后差距可归因于 BN 运行统计量,而非遗忘方法对权重的修改,从而把测量失败与编码器失败区分开。实验显示,该伪影在标准基准的九种方法上最多逆转 78 个百分点的遗忘准确率;攻击者仅用 10 张无标签图像即可恢复大部分被掩盖的准确率;改用严格的 GroupNorm 后,所有方法的伪影降为零。测试的成员推断攻击在重新校准后变化不大,说明评测失败集中在遗忘准确率和线性探测上。
- 动态SPY Lab
SPY Lab 研究:机器学习隐私防御的评测存在误导
SPY Lab 的研究发现,现有对启发式机器学习隐私防御的评测可能严重低估隐私泄露,在 CIFAR-10 上把各防御(含 DP-SGD)调到至少 88% 测试准确率时,既有评测对泄露的低估可达五十倍。作者指出常见评测的三个问题:只关注群体层面的隐私、使用弱且非自适应的攻击、对比低效用的 DP 基线。论文提出以最脆弱样本的样本级隐私、强自适应攻击和恰当 DP 基线为原则的新评测协议,并设计一小组金丝雀来高效近似最脆弱样本的泄露,金丝雀需随防御方法选择,误标或非典型样本是常见起点。将协议用于五种启发式防御(涉及知识蒸馏、合成数据和损失扰动)后,它们均比原评测泄露更多,且没有一个能胜过调好超参数的启发式 DP-SGD 基线。
- 论文arXiv
IDUnlearn-Bench:面向视觉语言模型的个体级遗忘基准
研究者提出 IDUnlearn-Bench,称其为首个面向视觉语言模型个体级多模态遗忘的基准,把每个人表示为相互关联的多模态证据,并设置属性访问、身份访问、身份绑定和身份重建四类任务。在代表性 VLM 和遗忘方法上的实验显示,属性层面的遗忘成功往往仍保留大量身份级知识,且效果可能非单调,降低一类风险反而放大另一类。模型可能压制部分信息,却仍能识别目标、关联记录或重建该个体。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门