跳到正文

#arXiv

今天收录 1 条

第 5 页更新的内容回到最新

9月12日周六
  1. arXiv:越狱与提示注入 ·

    Mind the Gap:检测 DAO 治理中的描述-执行不匹配攻击

    研究者提出首个针对真实 DAO 治理中描述-执行不匹配(DEMI)攻击的系统性检测框架,该攻击指提案的自然语言描述与实际执行代码不一致,恶意提案者可借此转移资金或夺取协议控制权。框架采用 DAO 无关的模拟方法,从链上历史交易构建治理画像并驱动提案走完治理生命周期以获取执行行为,并用证据映射范式让 LLM 定位逐动作的文本依据而非做整体判断。在真实以太坊 DAO 治理数据集上,模拟覆盖 92.7% 活跃 DAO 和 89.3% 已执行提案,检测器在分层交叉验证下平均精确率 81.7%、召回率 98.3%,证据映射可跨 LLM 厂商泛化,Robustness Guard 在红蓝队评估中可防御多数自适应攻击。

9月11日周五
  1. arXiv:越狱与提示注入 ·

    Trace2ATT&CK:基于图的 eBPF 内核遥测到 MITRE ATT&CK 映射方法

    Trace2ATT&CK 通过 eBPF 采集内核级事件、将攻击者命令关联为溯源图并生成紧凑图表示,再用纯 LLM 提示与基于 ATT&CK 知识库的 RAG 映射到 MITRE ATT&CK,输出排序后的技术候选及理由。在 347 个 Linux Atomic Red Team 测试上使用本地部署的开源权重 LLM 评估,RAG 持续优于纯提示,溯源图显著优于原始遥测,且本地推理无需牺牲数据机密性。

  2. arXiv:Agent 与 MCP 安全 ·

    面向企业智能体持续部署的 Agentic Company OS:认知基座反转

    一篇立场论文提出,企业 AI 智能体演示成功却难以长期运行,根源在于其推理所依赖的数据是为人类操作者而非语言模型组织的。作者主张围绕匹配推理界面的表示重建"认知基座",将 schema 转换隔离到动作边界,并以 Markdown 作为当下可用的实例。论文提出 Data、Knowledge、Intelligence、Governance 四层框架,由 Sync Agent 执行动作边界与逐技能信任梯度,并分析了编译路径上的间接提示注入等风险。

  3. arXiv:对齐与欺骗 ·

    SteerDuplex:可操控的全双工语音对话模型

    SteerDuplex 是一个基于 Moshi 微调的全双工语音对话模型,通过自然对话与合成对话训练提升指令跟随、发声表现与双工交互能力,并采用两阶段强化学习结合可验证交互检查与评判式语义反馈优化时序与响应连续性。团队同时提出 SteerBench 基准,含 390 条语音提示和 1,067 条人工编写的音频与文本评分标准,覆盖语气、人设、风格/口音和语速/长度。

  4. arXiv:后门、投毒与隐私 ·

    基于 Hessian 分析的相关性引导快速机器遗忘

    一种面向网络与分布式安全系统的机器遗忘框架通过识别训练集中的相关数据点并应用闭式参数更新规则,相比标准影响函数遗忘实现 82 倍墙钟加速,准确率较 SOTA 基线提升 10^-2。该方法借助 Hessian 阻尼保证数值稳定性,在包括 CIFAR-100 与 ResNet-50 在内的七种数据集-架构组合上评估,成员推理攻击成功率为 0.660,tug-of-war 得分为 0.950。

  5. arXiv:对齐与欺骗 ·

    Direct Preference Density Alignment:面向对话式音频均衡的对齐框架

    研究提出 Direct Preference Density Alignment,用约 90,000 条用户数据构建非参数偏好密度图作为经验奖励面,从而无需学习代理奖励模型,同时保留在线强化学习能力。该方法将 GRPO 的在线结构 grounding 与 DPO 的离线精调结合,在盲听音频均衡测试中让 1.5B 参数模型达到精心设计提示词的 GPT-4o mini 基线的感知水平,且推理算力消耗仅为后者一小部分。

  6. arXiv:可解释性 ·

    研究指出解码器余弦相似度在 SAE 特征流发现中的失效

    研究以 MLP 更新为切入点,构建残差状态特征与更新特征共同预测目标残差特征的三元组转移图谱,并通过消融解码后的更新特征来验证候选三元组。在 Pythia-160M 的 L7 到 L8、20M token 实验中,共发现 38,125 个强消融效应转移,但其中 88.0% 的状态-目标与更新-目标解码器余弦相似度都低于 0.7。作为跨模型初步检验,Gemma-3-4B 的 L21 到 L22、20M token 实验只对排名前 30,000 的候选三元组做因果验证,强效应三元组中有 53.6% 的两项余弦相似度均低于 0.7。

  7. arXiv:对齐与欺骗 ·

    EvoRS:面向开放式强化学习的奖励系统在线自演化框架

    EvoRS 是一个让奖励系统随策略在线自演化的强化学习框架,用于开放式任务中基于评分标准的奖励。作者指出策略与奖励系统构成动态反馈回路,策略优化当前奖励后,原本有效的奖励系统可能因奖励作弊或响应区分度下降而变得不可靠,因此奖励系统应在训练中持续演化而非固定不变。EvoRS 将奖励系统表示为可执行的 Reward-DAG,由智能体式设计器根据在线 rollout 和奖励轨迹更新该系统,以维持训练期的可靠性。在写作和角色扮演任务上,EvoRS 在三种评判模型下均取得最佳质量,分别比策略高出 2.107 分和 4.767 分,同时减少了奖励作弊和覆盖失败,并保持奖励信息量。

  8. arXiv:对齐与欺骗 ·

    Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现

    Odin 是首个开源的端到端 GPU CKKS 实现,可在加密状态下完成 Llama-3-8B 推理。它通过 feature-major 跨层布局统一残差连接与层接口,并为线性投影和注意力构建临时算子内布局,减少权重的冗余明文编码;注意力中 QK^T 的分数可直接被 Softmax 消费,PV 直接消费概率,避免中间重打包;非线性运算采用带输入范围控制的 minimax 多项式近似与联合误差分配。在单张 NVIDIA H100 80 GB GPU 上,输入 128 token 时评估全部 32 层耗时 366.4 s、峰值显存 58.9 GiB,相比 THOR 的 1651.9 s 提速 4.51 倍。

  9. arXiv:后门、投毒与隐私 ·

    PL-MIA:基于成对似然比的成员推理攻击

    研究者提出 Pairwise Likelihood MIA(PL-MIA),将高斯似然比(GLR)统计量与总体校准、Cauchy 组合检验结合,用于审计机器学习模型的成员隐私风险。该方法对查询点与未参与训练的参考点做成对比较得到 p 值,再用 Cauchy 组合检验聚合连续信号,保留被二值投票丢弃的证据强度。实验显示,在低假阳性关键区间,PL-MIA 的真阳性率(TPR)较强基线提升超过 25%。

  10. arXiv:对齐与欺骗 ·

    现实才是最终验证者:智能体软件工程的两大关键缺口

    论文提出"两缺口框架",将智能体软件工程的主要失败模式统一为需求缺口与模型缺口:奖励作弊利用需求或模型中的遗漏,模型幻觉则通过编造需求或环境假设扩大缺口。由于在开放变化的世界中两个缺口无法被证明闭合,目标应从闭合转为持续收窄,作者据此提出利用部署证据修订需求、模型或评估器的保障-修订循环,并将有保障的智能体开发视为人类判断、智能体能力与算力的资源分配问题。

  11. arXiv ·

    人类打造的最后一个 AI:迈向真正的递归自我改进

    论文提出用 Headroom-Closed Index(HCI)揭示现有 LLM 的问题,并给出递归自我改进(RSI)的发展路线图:从改进执行自主、改进策略自主、经验获取自主、环境适应自主,直到递归元改进。研究进一步考察 RSI 在科学发现、具身智能、软件工程等场景中的不同需求与发展速度,并结合业界实践与初步实证,指出实现真正 RSI 的关键挑战。

  12. arXiv:后门、投毒与隐私 ·

    用权重谱密度预测隐私泄露:WeightWatcher 谱指标可作为成员推理攻击脆弱性的代理

    研究发现,来自重尾自正则化框架的 WeightWatcher 谱指标可替代昂贵的影子模型,用于评估机器学习模型的成员推理攻击(MIA)风险。在图像与表格分类任务上,stable rank 与整体 MIA 成功率呈强正相关,Log alpha-Norm 在低假阳性区间与 MIA 脆弱性持续负相关,且这两种关联均强于泛化差距所给出的结果。这表明神经网络谱中包含过拟合常规指标未能捕捉的隐私泄露信息,为可扩展的隐私审计提供了新方向。

9月10日周四
  1. arXiv:可解释性 ·

    超越求解器判定:面向自动形式化的生成式奖励模型

    研究提出 Verdict-Preserving-Unfaithfulness(VPU)失效模式:错误的形式化翻译仍能通过求解器并得到预期判定,并证明仅依据判定的结构性验证启发式检测能力在数学上被限制在随机水平。为此提出 Generative Verification(GenV),将离线 Z3 等价性 oracle 蒸馏为无参考的连续参考等价性评分,机制分析显示其可原生提取精确的空间错误坐标。oracle 挖掘的验证器 GenV+HN 在参考等价性验证上达到 0.961 AUROC,零样本泛化到未见翻译器与不同形式风格,并在智能体测试时算力分配上带来 11.3 个百分点的下游准确率提升。

  2. arXiv:对齐与欺骗 ·

    BenchShield:面向 LLM Agent 评测基础设施的奖励完整性形式化插桩

    论文提出 BenchShield,一个以形式化模型为支撑的插桩层,用于保障 LLM Agent 评测中的奖励完整性。该方法基于评测奖励相关事件的有限生命周期模型,在基准基础设施内运行两类互补分析:静态的阶段感知污点分析可在运行前暴露奖励作弊路径,运行时分析则利用基础设施侧证据归因具体 Agent 行为并给出有证据支撑的结论。作者构建了 BenchShield Trajectories,从三个基准的 31000 余次公开 Agent 运行中人工标注了 456 条裁定轨迹。

  3. arXiv:Agent 与 MCP 安全 ·

    随机抽样 MCP 注册表:仅 48.8% 服务器完成初始化握手,BFCL v4 工具描述重复率 16.7%

    研究对 MCP 服务器生态做了一次未修复的概率抽样,从 24,135 台服务器的注册表普查中按公开随机种子抽取 400 台 npm/stdio 服务器并逐一在线探测。结果显示仅 48.8% 能完成 initialize 握手,而同一工具测得的人工筛选样本为 66.7%;主要失败原因不是缺少凭证(13.3%),而是服务器根本无法启动(37.5%)。在 195 台可运行的服务器中,2,766 个对外声明的工具没有出现致命 JSON Schema 违规,差异集中在可选安全标注上,随机抽样下的工具级遗漏率为 58.8%,人工筛选样本为 41.5%。

  4. arXiv:后门、投毒与隐私 ·

    监督学习中的数据投毒攻击实证评估:标签翻转与后门投毒在 MNIST 和 Fashion-MNIST 上的对比

    研究在 MNIST 和 Fashion-MNIST 上评估了标签翻转与后门投毒两类训练时攻击,对比 Logistic Regression、Linear SVM 和 Random Forest 三种基线分类器,投毒率设为 5%、10% 和 20%。标签翻转导致明显性能下降,Logistic Regression 和 Linear SVM 受影响最大,Random Forest 相对稳定;后门投毒在全部数据集和模型上攻击成功率达 0.9667 至 1.0000,且干净测试性能常接近基线。结果表明无差别投毒会体现在常规指标中,而定向后门投毒更具隐蔽性,需采用面向安全的评估方法。

  5. arXiv:后门、投毒与隐私 ·

    针对 NLP 文本分类器的成员推理攻击实证评估:SST-2 基线研究

    一项在 GLUE SST-2 情感数据集上的受控基准测试比较了 TF-IDF + Logistic Regression 与微调 DistilBERT 在 loss-threshold 成员推理攻击(MIA)下的隐私泄露情况。DistilBERT 开发集准确率 0.9466、macro F1 0.9460,Logistic Regression 为 0.8756 和 0.8727,但两者均泄露成员信号,攻击 AUC 分别为 0.5615 和 0.5800。

  6. arXiv:Agent 与 MCP 安全 ·

    DriftNet:双头轨迹 Transformer 检测并定位 LLM Agent 中的提示注入

    Asif Pinjari 提出 DriftNet,一个双头轨迹 Transformer,读取已记录的工具调用轨迹并在一次前向中回答三个问题:轨迹是否被攻陷、攻击从哪一步进入、哪些步骤被劫持,第二个头为每一步打上 benign、injection point、hijacked 或 failed injection 四类标签。该方法用冻结的句子编码器和四个不含身份信息的世界特征嵌入每一步,主干参数量不到两百万,采用类别加权的双头联合目标训练,无需访问 Agent 自身的模型。

  7. arXiv:Agent 与 MCP 安全 ·

    MCPSEC:仅凭工具元数据检测 MCP 服务器间接提示注入漏洞

    研究者提出 no-box 漏洞分析范式,在既无系统访问权限也无运行时交互、仅有功能元数据的条件下,推断系统所有可能实现中都存在的漏洞。他们实现了原型 MCPSEC,仅利用 MCP 服务器注册时暴露的工具元数据审计间接提示注入漏洞。在 20 个广泛部署的 MCP 服务器、共 177 个工具上评估,人工评估者确认 95 个工具存在漏洞,MCPSEC 判定 143 个工具存在漏洞,并为每个漏洞工具给出漏洞假设与利用技术。仅凭元数据,MCPSEC 预测出 94 个经人工验证的真实漏洞,召回率 98.9%,高于 LLM 基线的 80 个、84.2%。

  8. arXiv:可解释性 ·

    GeoSteer:面向大语言模型激活引导的测地线优化方法

    GeoSteer 是一种基于优化的保范激活引导方法,把激活引导建模为黎曼优化问题,通过在表示流形上连续小步测地线更新激活来控制 LLM,并用学习到的非线性激活空间目标自适应引导每一步,避免固定引导方向。在 TruthfulQA、RealToxicityPrompts 和 UltraFeedback 基准上,GeoSteer 一致优于当前最先进的激活引导基线。结果表明,用自适应、几何感知的优化替代预定义的单步编辑,可让保范引导更有效。

9月9日周三
  1. arXiv:可解释性 ·

    SAE 相图实验未观察到字典恢复或特征合并,训练模型收敛到弥散相

    作者按 MAIS-O43 开放问题指定的协议实现实验,在 165 个网格单元中的 10 个上评估了 200 次独立初始化的拟合,观察到零次完整字典恢复和零次特征合并。每次运行都收敛到一个可复现的弥散相:重建几乎完美,但学习到的原子通常远离真实特征,最佳余弦中位数为 0.5-0.7,低于 0.95 的恢复判据,且学习到的编码比真实值稠密一个数量级。该行为在稳健性检验中持续存在,并在使用标准 minibatch Adam 的完整 165 单元网格上通过额外 3300 次拟合得到验证。

  2. arXiv:越狱与提示注入 ·

    AIOS 的内核管理共享内存:面向系统级个性化的新抽象

    研究提出"内核管理共享内存",由智能体系统内核而非单个智能体统一负责记忆检索、隐私执行与提示注入。该设计在 AIOS 上实现,用 GPT-4o、Llama-3.1:8B、Qwen-2.5:7B 三个助手模型共 1800 次试验,对比 Mem0 等三种方案:个性化得分提升 2.4-4.0 分(5 分制,GPT-4o 上 profile usage 从 1.05 升至 4.69),端到端延迟降低 15-61%,并减少每次调用的 token 用量与推理成本。

  3. arXiv:可解释性 ·

    基于 Transformer 的声学模型中的稀疏权重与边电路发现

    研究者将 DiscoGP 电路发现框架从文本解码器扩展到语音编码器,在 HuBERT 和 Wav2Vec 2.0 上开展首个现代语音基础模型电路发现研究。发现的电路极为紧凑,却常能匹配甚至超过完整预训练编码器加下游头的性能,消融实验表明其反映的是预训练计算而非随机结构或任务头伪影。团队还提出内存高效变体,将边电路发现的 GPU 显存开销从四次方降至三次方。

  4. arXiv:越狱与提示注入 ·

    Belief-State Engine:为部分可观测环境下的 LLM 智能体补上信念状态

    论文提出 Belief-State Engine(BSE),一个置于 LLM 之外的推理模块,为给定 POMDP 的隐状态维护贝叶斯后验,并在每一步只把该后验暴露给 LLM,而不展示原始动作-观测日志。作者给出信念一致内部状态需满足的四条最小公理,并证明在 LLM 不接触原始历史的前提下,LLM 与 BSE 的组合是信念 MDP 上的可靠马尔可夫策略,从而继承经典 POMDP 理论的 Bellman 最优性保证。

  5. arXiv:可解释性 ·

    解读文本到图像扩散模型中的对象依赖概念脆弱性

    文本到图像扩散模型存在一种"对象依赖概念脆弱性":仅对象不同的少量提示词在相同生成设置下持续无法实现同一目标概念,表现为系统性内部盲点而非随机噪声。研究者提出可解释性框架,在逐步稀疏自编码器(SAE)空间中分析去噪轨迹,比较成功与失败生成,定位证据缺失、减弱或延迟的概念维度,并构建类别级概念原型。基于该审计流程,引入轻量推理时校正策略,将去噪特征向 SAE 空间中的对应原型插值,在多个扩散骨干模型的风格与属性失败案例上显著提升概念一致性、文本保真度与修复成功率。

  6. arXiv:后门、投毒与隐私 ·

    CGMIA:用成员推理攻击检测代码生成基准的数据泄漏

    针对代码生成基准数据泄漏导致评测虚高的问题,研究者提出 CGMIA(Code-Generation-specific Membership Inference Attack),通过在基准样本子集上微调影子模型构建成员与非成员标注数据,并融合 CodeBLEU、编辑距离、测试通过率、困惑度等专家特征与 CodeBERT 嵌入语义特征进行集成学习,判断样本是否进入目标模型训练集。在八个代码生成基准上,CGMIA 多数情况下优于八种现有成员推理方法,并有效检出 StarCoder-7B 训练数据中已知泄漏的 APPS 样本。

  7. arXiv:后门、投毒与隐私 ·

    差分隐私合成文本的子群成员推断审计

    针对差分隐私合成文本发布,研究提出子群定向成员推断博弈,将目标池设为显式参数,在四个数据集、三种生成器(DP-SGD 微调、API 提示、激活引导)和五个隐私预算下审计了 32 个代理。审计显示合成发布确实泄露子群成员身份,既有攻击系统性低估该泄露;DP 在各预算下大幅降低平均泄露,但剩余泄露集中,十分之一记录约占 40%,且噪声对随机记录的去泄露效果强于高风险记录,哪些记录泄露取决于发布机制而非记录本身。

  8. arXiv:对齐与欺骗 ·

    面向联邦 LLM 微调的隐私保护拆分学习

    针对联邦拆分学习中 LLM 自回归特性导致中间激活泄露输入、现有扰动防御失效的问题,研究者提出一种可学习的混淆—恢复方案,在保护参与者私有数据集的同时仍能在服务器端训练可独立部署的模型。实验显示该方法在实现强隐私保护的同时仅带来适度的效用损失和系统开销,使基于拆分的联邦 LLM 微调具备实际可行性。

  9. arXiv:可解释性 ·

    MonoTM:用可解释单义特征做主题建模,超越关键词表示

    MonoTM 是一个可解释主题建模框架,将文档-主题混合估计与语义解释解耦:混合估计使用完整的 SAE 特征词袋表示,主题描述符则在固定的混合结果上、从另一套基于语料的语义特征词表中学习。在三个基准语料上,研究发现混合估计与语义解释偏好不同的 SAE 配置和特征子集。该设计在保留全局主题结构的同时,用比单个词更有意义的语义单元表示主题,便于下游语料分析。论文已被 AACL-IJCNLP 2026 接收。

  10. arXiv:后门、投毒与隐私 ·

    基于神经形态时序嵌入与混合 SNN-XGBoost 的工业信息物理系统鲁棒分类:面向机器遗忘攻击

    研究提出一种混合 SNN 与 XGBoost 架构,用脉冲神经网络做固定时序特征提取器、仅重训 XGBoost 分类器,以提升电力系统入侵检测对机器遗忘攻击的鲁棒性。在两个真实电力系统数据集上,Synchrophasor 达 99.9% 准确率(F1-macro 0.999),MSU/ORNL 达 95.0% 准确率(F1-macro 0.943)。在选择性标签翻转攻击下,10% 投毒时 F1-macro 仅下降 0.9%,目标类崩溃阈值从 60% 投毒推迟到 70%。

  11. arXiv:可解释性 ·

    特征叠加中线性可达性的高概率保证:IHT-SAE 突破线性可达上限

    研究者将线性可达性建模为压缩感知问题,在次高斯噪声下为固定支撑导出高概率界,证明所需维度随 $d=O_{\varepsilon}(k \log m)$ 线性增长,而非此前最坏情况下的二次上限。工作刻画了活跃与非活跃特征干扰的不对称性,以及干扰预算与观测噪声预算之间的权衡,并通过高斯尾部近似在系统参数上验证了这些界。作者还提出 IHT-SAE,用学习式迭代精修提升特征恢复能力,突破线性可达性限制,为评估稀疏自编码器、组合泛化与神经网络可解释性提供框架。

  12. arXiv:对齐与欺骗 ·

    适应性计算原语理论:用六种原语解释 AI 的幻觉、提示注入与奖励作弊

    一篇论文提出「适应性计算原语理论(CPT)」,认为所有适应性系统都需计算六种原语操作:Arouse、Orient、Valence、Position、Boundary 和 Attune,其筛选标准为存在必要性、跨独立演化谱系的普遍性、演化保守性和不可约性。该框架在人工系统中被用来重新审视机器智能的当前挑战,包括 confabulation、提示注入、易分心、奖励作弊和灾难性遗忘,并暗示这些问题可能源于缺少这些计算。作者强调 CPT 目前仍是待完善的工作假设,需通过讨论、实证测试和应用进一步检验。

  13. arXiv:可解释性 ·

    SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究

    论文提出 SAEScientist-Bench,用于评估 AI 智能体能否像研究者一样使用 SAE 工具自主完成机制可解释性发现。给定目标概念后,智能体需设计对比探针,并在 Gemma-2-9B-IT 的 Gemma Scope 字典中检索 131K+ 个特征,找出最优特征。评测以 Neuronpedia 上经专家整理的参考特征为基准,从激活排名、对比文本上的概念选择性以及因果引导三个维度打分。在 10 种智能体配置和 20 项任务中,前沿智能体展现出真实的发现能力,并在不同评测维度上各有领先,但整体仍明显落后于专家基线:在区分目标概念与对比控制项上接近专家水平,在因果生成引导上差距较大。

  14. arXiv:越狱与提示注入 ·

    PrivEscalate:面向 LLM 自动化 Linux 提权的 531 场景基准与 PrivEscAgent 增强方案

    研究者提出 PrivEscalate,一个包含 531 个 Docker 化场景、覆盖 14 个子类别的 Linux 提权大规模基准,并额外派生 329 个参数化变体以测量对环境干扰的敏感性。在三种智能体架构上评测六个 LLM 后发现:模型能力在不同漏洞类别间差异明显,没有单一模型在高发类别上全面领先;提权成功对环境扰动敏感,配置轮换能打断部分利用尝试但无法消除风险;智能体架构会显著改变成功率并重排模型名次,幅度因模型而异。基于这些发现,作者开发 PrivEscAgent,在通用 ReAct 智能体上加入确定性枚举、类别匹配和步骤规划,在不修改底层 LLM 的情况下优于此前的 Linux 提权智能体基线。

  15. arXiv:可解释性 ·

    Training-Free Task Vectors:无需微调的 LLM 行为控制方法

    研究者提出 Training-Free Task Vectors(TFTVs),无需微调即可计算类任务向量方向,仅用前向传播统计将激活引导向量映射为秩一权重空间编辑,并支持加法学习、减法遗忘与多编辑组合。在 LLM 行为控制任务上,TFTVs 能持续放大、抑制和组合目标行为,同时保留通用知识与解题能力,相比其他编辑与引导基线实现了更强的特质控制,效用保持相当或更优。代码已在项目网站公开。

9月8日周二
  1. arXiv:后门、投毒与隐私 ·

    论文揭示 BatchNorm 架构下机器遗忘评测的归一化伪影

    论文发现基于 BatchNorm 架构的机器遗忘评测存在一个此前未被记录的混杂因素:对保留数据做一次前向传播、不修改任何权重,就能确定性地改写模型的归一化状态,并逆转表面指标上的遗忘效果。作者将该操作形式化为保权重的固定点算子,并证明其造成的遗忘前后差距可归因于 BN 运行统计量,而非遗忘方法对权重的修改,从而把测量失败与编码器失败区分开。实验显示,该伪影在标准基准的九种方法上最多逆转 78 个百分点的遗忘准确率;攻击者仅用 10 张无标签图像即可恢复大部分被掩盖的准确率;改用严格的 GroupNorm 后,所有方法的伪影降为零。测试的成员推断攻击在重新校准后变化不大,说明评测失败集中在遗忘准确率和线性探测上。

  2. arXiv:后门、投毒与隐私 ·

    WPMIA:面向严格黑盒大模型的词级概率成员推断攻击

    研究者提出 Word-level Probability MIA(WPMIA),一种面向严格黑盒场景的成员推断攻击,用于判断某段文本是否被纳入大语言模型的训练语料。该方法通过蒙特卡洛采样结合局部核平滑估计词级生成概率,再聚合成序列级似然估计,并构造不同前缀条件下的似然以放大成员与非成员之间的分布差异。在多个开源大语言模型上,WPMIA 一致优于现有黑盒基线;在 GPT-5-Chat、Gemini-2.5-Flash 和 Claude-4.5-Haiku 等闭源模型上,平均 TPR@5%FPR 达到 42.0。论文共 17 页、5 张图、17 张表,代码已公开。

  3. arXiv:越狱与提示注入 ·

    语言、越狱与简洁性:LLM 属性引导向量的免训练组合研究

    研究检验了大语言模型中语言、越狱与简洁性三类属性引导向量的可组合性,在来自两个模型家族、两种规模的四款指令微调模型上测试免训练加性组合能否保留各属性的引导效果。单属性引导在三类属性上均可靠,但需匹配合适的干预层与引导强度:抽象行为(越狱、简洁性)偏好中间层,语言偏好更早的层。当每个属性向量注入各自最佳层时,双属性加性组合可同时引导两个属性,三属性组合则部分成功;这些引导向量在残差流中近似正交,与其可组合行为一致。

  4. arXiv:可解释性 ·

    多语言 LLM 中的刻板印象如何从内部表征传导到输出:Llama-3.1-8B、Qwen3-8B 与 Gemma-2-9B 的机制对比

    研究对比线性探针、归因修补、稀疏自编码器(SAE)与特征消融,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中追踪多语言刻板印象从内部表征到输出的路径。三个模型的探针性能峰值均明显早于归因,相差 36-53% 的模型深度。评估的残差流特征中仅 6-18% 具有语言无关效应,且无一具备类别无关效应,说明可解码性、输出影响与跨语言消融效应需分别测量。