跳到正文
10月10日 · 周六

全部论文

找到 30 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2610.12235

    论文提出用语言模型充当 AI 研究世界模型,预测实验结果

    提出研究世界模型,用语言模型预测干预增益

    发表
    被测模型
    Claude Opus 5、Grok-4.6、GPT-6 Astra 等 13 个
    摘要作者称实验记录可在环境内外复用,并改善固定预算下的实验选择。

    作者把语言模型用作研究世界模型,在执行前预测干预增益的中位数,用来在有限预算下比较候选实验。要处理的缺口是研究智能体提案快于执行。同一类改动在不同参考模型、配方和预算下效果可以不同,因此需要能离开原环境继续使用的实验知识。

    深度解读完整解读
  2. 其他arXiv 2610.06452

    研究者提出多模态安全评测应衡量可控性而非仅做分类

    主张多模态安全评测应衡量可控性,并用 SAE 建立四轴画像

    发表
    被测模型
    LlavaGuard-v1.2-7B-OV、Qwen3.5-9B
    摘要四轴画像把读出与选择性控制分开。

    作者主张多模态安全评测在行为分类之外,单独报告可控性画像,而不是把检测准确当成控制证据。

    深度解读完整解读
  3. 其他arXiv 2610.06317

    论文提出可审计的文本水印合规方案以落实欧盟 AI 法案第 50 条

    把文本水印证据写成带错误率的三态可审计结论

    发表
    摘要把水印合规从普遍检测改成带范围的证据曲线、三态报告和再校准,模拟支持平方修正。

    指定配置下的文本水印被做成可审计测量:记录证据如何衰减,并把检测收成三态,而不是判定人类作者身份。

    深度解读完整解读
  4. 其他arXiv 2610.04792

    多模态一定更好吗?缺失模态鲁棒性的几何视角与 Geodesic Unlearning 方法

    提出 Geodesic Unlearning,沿测地线编辑权重以提升缺模态鲁棒性

    发表
    被测模型
    RoBERTa、ResNet50、Qwen2.5-3B 等 6 个
    摘要GU 用测地线子空间编辑应对部署时缺模态下降,并尽量保住全模态精度。

    这项工作讨论多模态模型在部署时整段缺一个模态的性能下降,并把校正写成训练后的子空间编辑。

    深度解读完整解读
  5. 其他arXiv 2610.06950

    低秩激活引导实现参数高效决策算子:330K 参数匹配 1.33M 强化学习算子

    提出 DecSteer,用共享低秩残差算子把审议收成直接决策

    发表
    被测模型
    Qwen3.5-4B、Llama-3.2-3B-Instruct、Qwen3.5-0.8B
    摘要DecSteer 用小参数 BC 算子把长推理收成短决策,增益随基座余量变化并可组合。

    DecSteer 是加在冻结语言模型残差流上的 System-1 决策算子,用行为克隆代替强化学习来调用模型里已有的技能。

    深度解读完整解读
  6. 其他arXiv 2610.03389

    Patch-to-Prune:在 Qwen2.5-VL 与 LLaVA 上剪枝视觉计算

    提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算

    发表
    被测模型
    Qwen2.5-VL-3B-Instruct、Qwen2.5-VL-7B-Instruct、LLaVA-v1.6-Vicuna-7B-HF 等 4 个
    摘要P2P 用深度上的激活修补旁路视觉投影,以可调容忍度交换准确率与计算量。

    P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。

    深度解读完整解读
  7. 其他arXiv 2610.03093

    LS-AR 双通道架构:文本目标丢弃可抵御提示注入但引入潜在向量攻击面

    提出 LS-AR,用潜向量经 FiLM 调节自回归解码以保持宏观目标

    发表
    被测模型
    LS-AR (Static)、LS-AR (Dynamic)
    摘要用潜通道把宏观目标从 token 流拆出,并在合成检索与规划上比较静态、动态两种调节。

    LS-AR 给因果解码器加一条不占窗口的连续目标通道,用来处理长程生成里宏观指令被挤出上下文或被注意力稀释的问题。

    深度解读完整解读
  8. 其他arXiv 2610.02391

    HEST:用熵训练的双曲探针实现稀疏激活引导

    提出 HEST,用熵训练的双曲探针只在犹豫 token 引导隐状态

    发表
    被测模型
    Qwen2.5-Math-1.5B-Instruct、Qwen2.5-Math-7B-Instruct、Llama-3.1-8B-Instruct
    摘要只改高熵 token 的双曲转向,多数设置高于 greedy,全 token 固定向量则下降。

    HEST 是不更新语言模型权重的推理时转向:模型自己的 next-token 熵既选出少数犹豫 token,也训练给出方向的双曲探针。要处理的情况是,数学解答里多数 token 已由上下文决定,分叉集中在高熵 token,而常见激活加法仍对每个 token 加同一欧氏向量。长推理模型上按关键词和步骤边界转向的做法,又很少适用于 instruction-tuned 模型。

    深度解读完整解读
  9. 其他arXiv 2610.01995

    AI 监督能否做到零知识?论文证明一般情形下不可行

    证明随机谕示下谕示辅助计算无法零知识验证,签名谕示下则可

    发表
    摘要随机谕示排除一般零知识监督。

    一般谕示辅助计算在随机谕示中做不到 witness hiding,因而也做不到零知识监督。给谕示答案加上数字签名后,抗碰撞哈希足以同时得到隐私和简洁验证。

    深度解读完整解读
  10. 其他arXiv 2610.01005

    基于容忍度的公平性审计:违规认证与敏感性筛查

    提出容忍度公平性审计,用 CEL 认证违规并用 SEL 筛查

    发表
    被测模型
    COMPAS
    摘要容忍阈值下,CEL 做违规认证,SEL 与 ASEL 做更敏感的筛查。

    这篇工作给出一套按审计目标切换校准的容忍公平审计:差异不必为零,而是看预先指定的不利方向上是否超过允许阈值。

    深度解读完整解读
  11. 其他arXiv 2609.40034

    ALeBi:用 bias probe 主动审计多群体公平性

    提出 k-ALeBi 偏差探针,主动审计黑盒模型的多组公平性

    发表
    被测模型
    linear model、random forest、MLP
    摘要偏差探针把多组公平审计变成比较函数学习,并分开审计与重构。

    k-ALeBi 把黑盒多组公平审计写成跨组比较函数的学习,而不是先重构分类器。

    深度解读完整解读
  12. 其他arXiv 2609.21858

    基于泊松过程的可水印多草稿推测采样

    提出多草稿水印投机采样 MPFR,同时保持无偏水印与采样效率

    发表
    被测模型
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct
    摘要MPFR 用上下文索引的泊松过程做可水印多草稿投机采样,并保持停止时间草稿不变性。

    MPFR 是一种基于泊松过程的多草稿投机采样,用来同时提高解码效率并嵌入无偏水印。

    深度解读完整解读