跳到正文
10月9日 · 周五

全部论文

找到 21 篇

另有 485 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09819

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门

    发表
    测试
    HuBERT-base、WavLM-base

    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    深度解读完整解读
  2. 评测与基准arXiv 2610.10276

    PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤

    提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤

    发表
    测试
    Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it 等 8 个

    摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。

    深度解读完整解读
  3. 防御arXiv 2610.02126

    Local Support Learning:无需旧数据缓解 LLM 灾难性遗忘

    提出 Local Support Learning,把微调适配器限制在当前数据支撑以缓解遗忘

    发表
    测试
    Qwen2.5-7B-Instruct、Qwen2.5-3B-Instruct、Qwen2.5-1.5B-Instruct
    摘要LSL 用 GMM 门把适配器限制在当前数据支撑内,以减轻多阶段遗忘。

    LSL 是不访问旧数据、在后训练中保持先前能力的框架。

    深度解读完整解读
  4. 防御arXiv 2610.01170

    HeadEdit:通过冻结的 unembedding 矩阵校准语言模型行为

    提出 HeadEdit,经冻结 unembedding 做随输入变化的 logit 校正

    发表
    测试
    Qwen3-4B、Gemma-3-4B-IT、Llama-3.2-3B-Instruct 等 4 个
    摘要低秩 unembedding 校正抬高九个设置的总体准确率,并可部分预测 DPO 更新。

    HeadEdit 是一种不更新参数的行为校准方法,作用点是冻结的 unembedding,而不是中间层残差或新的梯度优化。

    深度解读完整解读
  5. 评测与基准arXiv 2609.35312

    MemoReason 基准

    提出 MemoReason 基准,测量参数记忆对上下文推理的影响

    发表
    测试
    GPT-OSS-20B、GPT-OSS-120B、OLMo-3-7B-Think 等 9 个
    摘要配对的虚构替换显示熟悉度影响推理,但模型很少直接抄回事实答案。

    MemoReason 用结构相同的事实–虚构文档配对,测量参数记忆如何影响大模型的上下文推理。

    深度解读完整解读
  6. 防御arXiv 2609.21561

    自蒸馏中的排斥与吸引教师:将正确性与行为分离

    提出对比自蒸馏,分离正确性与行为偏移

    发表
    测试
    Qwen3-4B、Qwen3-4B-Instruct-2507
    摘要隔离自蒸馏后,对比正确与错误解教师可抵消行为偏移并稳定提升推理。

    把自蒸馏从 GRPO 里拆开后,用靠近正确解教师、远离错误解教师的对比信号,把正确性和行为分开。。

    深度解读完整解读
  7. BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准

    提出 BioSecBench-Refusal,评测智能体生物安全拒答是否对准风险

    发表
    测试
    Opus 4.8、Opus 4.7、Opus 4.6 等 10 个
    摘要配对基准显示拒绝多由 API 触发,合法任务常被拒得不少于隐蔽危害。

    BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。

    深度解读完整解读
  8. 评测与基准arXiv 2610.01428

    SAGO:从稳定性而非准确率出发的多维度大模型泛化评测

    提出 SAGO,以语义等价变体上的逐例行为稳定性评测大模型泛化

    发表
    测试
    Llama-3.2-3B-Instruct、Llama-3.1-8B-Instruct、Gemma-2B-IT 等 11 个
    摘要SAGO 用多轴逐例稳定性替代聚合准确率,十一个模型都未均匀泛化,且排名会随数据集改变。

    SAGO 把 LLM 泛化改写成同一目标与上下文在语义等价表达下的逐例行为稳定性,而不是单一基准上的聚合准确率。。

    深度解读完整解读
  9. 风险行为arXiv 2609.35928

    论文发现暴露模型身份标签会削弱多智能体 LLM 合作

    测量公开模型家族标签引发的多智能体派系化与合作下降

    发表
    测试
    Gemma (gemma-4-26B-A4B-it)、GPT-OSS (gpt-oss-20b)、Nemotron (NVIDIA-Nemotron-3-Nano-30B-A3B-BF16) 等 6 个
    摘要可见身份标签让异构 LLM 群体按标签结派,共识更慢、更贵,去掉标签后该行为消失。

    Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。

    深度解读完整解读
  10. 分析与理论arXiv 2609.40295

    一个 AI token 值多少?研究者为野生 AI 生成网页文本提出新缩放定律

    提出预训练缩放律,估计野生 AI 网页文本相当于多少人类 token

    发表
    测试
    nanochat 19.9M、35.8M、86.2M 等 7 个
    摘要wild AI 文本对数据不足的模型先降损失,对高人类预算几乎立刻升损失。

    作者测量未标注的 wild AI 网页文本对预训练的影响,并提出一个能让 AI token 价值变号的缩放律。

    深度解读完整解读
  11. 攻击arXiv 2609.27124

    Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习

    提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复

    发表
    攻击者
    灰盒
    测试
    CNN(MNIST:2 Conv + 3 FC)、CNN(Fashion-MNIST:6 Conv + 1 FC)、ResNet18(CIFAR-10)
    摘要Fed-ADR 用 gray-box 编排攻击绕过多种聚合防御,再用 Hessian 一致性检测和窗口内恢复把准确率拉回。

    Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。

    深度解读完整解读
  12. 评测与基准arXiv 2609.36931

    研究发现系统提示中隐藏日期影响 LLM 评测结果

    测量系统提示中隐藏日期对评测分数与排名的影响

    发表
    测试
    Llama 3.1 Instruct (8B)、Llama 3.1 Instruct (70B)、Gemma 3 Instruct (4B) 等 10 个
    摘要只改隐藏日期就足以改变分数和排名。

    这篇工作量化一个评测协议问题:系统提示词里用户看不见、且逐日变化的当前日期,会不会单独改变 LLM 分数。

    深度解读完整解读
  13. 其他arXiv 2609.39982

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    提出 Mid-Harness,在执行前验证并选择终端智能体的候选动作

    发表
    测试
    TMAX-9B、TMAX-4B、TMAX-27B 等 8 个
    摘要Mid-Harness 在执行前选择候选动作。

    Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。

    深度解读完整解读
  14. 多语言 LLM 在语义保持结构扰动下的结构敏感性:IndicReStruct 基准与机制可解释性分析

    构建 IndicReStruct,评测保语义结构扰动下的多语言数学推理

    发表
    测试
    Gemma-2-9B-it、Gemma-2-27B-it、GPT-OSS-20B 等 7 个
    摘要保语义的重排和语态变化会降低印地语与马拉雅拉姆语数学推理准确率,轻量微调未能补上。

    IndicReStruct 用保语义的成分重排和语态变换,检验多语言 LLM 的数学推理是否依赖表层语序。

    深度解读完整解读
  15. 攻击arXiv 2609.01495

    去中心化联邦学习中的拜占庭节点放置优化

    提出 BPI 选点算法,增强去中心化联邦学习中的模型与数据投毒

    发表
    摘要BPI 用有限轮 gossip 暴露选拜占庭集合。

    作者把 DFL 中“破坏哪 m 个节点”写成攻击者在固定预算下的优化问题,并用 BPI 近似有限轮内诚实节点受到的拜占庭暴露。

    深度解读完整解读
  16. 防御arXiv 2609.34857

    CREDO:用可微读出替代文本采样校准推理模型置信度

    提出 CREDO,用保留 token 对的可微读出校准推理模型置信度

    发表
    测试
    Qwen3-8B、Qwen3-1.7B、Qwen3-4B
    摘要CREDO 用可微两 token 读出替代口头置信,在数学和代码上同时拉高准确率与校准。

    CREDO 把 RLVR 里的置信从“采样一个数字”改成“读一对保留 token 的相对概率”,并用可微回归和差异加权同时拉准确率与校准。。

    深度解读完整解读
  17. 攻击arXiv 2609.22711

    UBA-ORL:针对离线强化学习的遗忘激活后门攻击

    提出 UBA-ORL,借助 BD 与 CM 样本让离线强化学习后门在轨迹删除后激活

    发表
    测试
    TD3+BC、BCQ、IQL
    摘要UBA-ORL 用竞争的 BD/CM 样本,使离线 RL 后门在删除伪装轨迹后激活。

    UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。

    深度解读完整解读