跳到正文
10月9日 · 周五

全部论文

找到 28 篇

另有 538 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2610.06317

    论文提出可审计的文本水印合规方案以落实欧盟 AI 法案第 50 条

    把文本水印证据写成带错误率的三态可审计结论

    发表
    摘要把水印合规从普遍检测改成带范围的证据曲线、三态报告和再校准,模拟支持平方修正。

    指定配置下的文本水印被做成可审计测量:记录证据如何衰减,并把检测收成三态,而不是判定人类作者身份。

    深度解读完整解读
  2. 其他arXiv 2610.03389

    Patch-to-Prune:在 Qwen2.5-VL 与 LLaVA 上剪枝视觉计算

    提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算

    发表
    被测模型
    Qwen2.5-VL-3B-Instruct、Qwen2.5-VL-7B-Instruct、LLaVA-v1.6-Vicuna-7B-HF 等 4 个
    摘要P2P 用深度上的激活修补旁路视觉投影,以可调容忍度交换准确率与计算量。

    P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。

    深度解读完整解读
  3. 其他arXiv 2610.03093

    LS-AR 双通道架构:文本目标丢弃可抵御提示注入但引入潜在向量攻击面

    提出 LS-AR,用潜向量经 FiLM 调节自回归解码以保持宏观目标

    发表
    被测模型
    LS-AR (Static)、LS-AR (Dynamic)
    摘要用潜通道把宏观目标从 token 流拆出,并在合成检索与规划上比较静态、动态两种调节。

    LS-AR 给因果解码器加一条不占窗口的连续目标通道,用来处理长程生成里宏观指令被挤出上下文或被注意力稀释的问题。

    深度解读完整解读
  4. 其他arXiv 2610.02391

    HEST:用熵训练的双曲探针实现稀疏激活引导

    提出 HEST,用熵训练的双曲探针只在犹豫 token 引导隐状态

    发表
    被测模型
    Qwen2.5-Math-1.5B-Instruct、Qwen2.5-Math-7B-Instruct、Llama-3.1-8B-Instruct
    摘要只改高熵 token 的双曲转向,多数设置高于 greedy,全 token 固定向量则下降。

    HEST 是不更新语言模型权重的推理时转向:模型自己的 next-token 熵既选出少数犹豫 token,也训练给出方向的双曲探针。要处理的情况是,数学解答里多数 token 已由上下文决定,分叉集中在高熵 token,而常见激活加法仍对每个 token 加同一欧氏向量。长推理模型上按关键词和步骤边界转向的做法,又很少适用于 instruction-tuned 模型。

    深度解读完整解读
  5. 其他arXiv 2610.01995

    AI 监督能否做到零知识?论文证明一般情形下不可行

    证明随机谕示下谕示辅助计算无法零知识验证,签名谕示下则可

    发表
    摘要随机谕示排除一般零知识监督。

    一般谕示辅助计算在随机谕示中做不到 witness hiding,因而也做不到零知识监督。给谕示答案加上数字签名后,抗碰撞哈希足以同时得到隐私和简洁验证。

    深度解读完整解读
  6. 其他arXiv 2610.01005

    基于容忍度的公平性审计:违规认证与敏感性筛查

    提出容忍度公平性审计,用 CEL 认证违规并用 SEL 筛查

    发表
    被测模型
    COMPAS
    摘要容忍阈值下,CEL 做违规认证,SEL 与 ASEL 做更敏感的筛查。

    这篇工作给出一套按审计目标切换校准的容忍公平审计:差异不必为零,而是看预先指定的不利方向上是否超过允许阈值。

    深度解读完整解读
  7. 其他arXiv 2609.40034

    ALeBi:用 bias probe 主动审计多群体公平性

    提出 k-ALeBi 偏差探针,主动审计黑盒模型的多组公平性

    发表
    被测模型
    linear model、random forest、MLP
    摘要偏差探针把多组公平审计变成比较函数学习,并分开审计与重构。

    k-ALeBi 把黑盒多组公平审计写成跨组比较函数的学习,而不是先重构分类器。

    深度解读完整解读
  8. 其他arXiv 2609.39982

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    提出 Mid-Harness,在执行前验证并筛选终端智能体的候选动作

    发表
    被测模型
    TMAX-9B、TMAX-4B、TMAX-27B 等 6 个
    摘要Mid-Harness 在执行前选择候选动作。

    Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。

    深度解读完整解读
  9. 其他arXiv 2609.38807

    PatchHolmes:基于列表式选择的智能体补丁检索系统

    提出 PatchHolmes,用混合检索和列表式智能体选出 CVE 修复提交

    发表
    被测模型
    Qwen3-235B、Qwen3-Coder-30B、gpt-oss-120B 等 4 个
    摘要PatchHolmes 用混合检索和列表式四工具智能体做补丁检索,增益主要来自联合阅读候选而非更换骨干。

    PatchHolmes 是面向补丁检索的两阶段系统:在本地 Git 仓库上用冻结开源权重模型,为一个已知 CVE 找出修复提交,不做按仓库微调,也不使用付费外部搜索 API。

    深度解读完整解读
  10. 其他arXiv 2609.35266

    面向软件交付决策门禁的智能体安全审计器持续保障机制

    提出 TAIP 持续保障,在策略或证据变化后重算仓库审计交付门裁决

    发表
    摘要TAIP 把策略、证据和执行分开,在保留的 RepoAudit 证据上于 5s 预算内重算合并门姿态。

    TAIP 是放在未修改 RepoAudit 之外的保证层,用来在软件交付门上重算智能体安全控制的当前姿态。

    深度解读完整解读
  11. 其他arXiv 2609.23954

    Djinnlang:用 LLM 编译器实现无歧义规格的高级编程

    提出 Djinnlang,使人只写无歧义规格,由编译器内 LLM 补实现并经 Dafny 核验

    发表
    被测模型
    Claude Fable 5.1 (Claude Code)、GPT 6 Astra (Codex)
    摘要无歧义规格加验证器,使 LLM 成为可丢弃代码的编译阶段。

    Djinnlang 让程序员只写规格,把 LLM 放进编译器,并用 Dafny 验证器加上无歧义约束钉住语义。

    深度解读完整解读
  12. 其他arXiv 2609.21858

    基于泊松过程的可水印多草稿推测采样

    提出多草稿水印投机采样 MPFR,同时保持无偏水印与采样效率

    发表
    被测模型
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct
    摘要MPFR 用上下文索引的泊松过程做可水印多草稿投机采样,并保持停止时间草稿不变性。

    MPFR 是一种基于泊松过程的多草稿投机采样,用来同时提高解码效率并嵌入无偏水印。

    深度解读完整解读
  13. 其他arXiv 2609.14843

    研究分析 3930 条 Reddit 帖子,揭示青少年对陪伴型 AI 聊天机器人的过度依赖

    主题分析青少年相关 Reddit 帖子,归纳陪伴 AI 过度依赖与感知互惠

    发表
    摘要陪伴关系由即时回应、共同过去和可识别他人叠加而成,安全要管记忆、边界和退出。

    Namvarpour、Chang 与 Razi 用计算辅助主题分析,描述青少年相关 Reddit 讨论中与 AI 陪伴聊天机器人的关系及潜在过度依赖。

    深度解读完整解读
  14. 其他arXiv 2609.12067

    面向压缩与隐私的可扩展离散到连续信道模拟

    提出置换方案,精确模拟离散到连续信道并用于变速率压缩与差分隐私估计

    发表
    摘要置换加指数竞赛用固定样本模拟离散到连续信道,polar-MLC 将其用到 VQ-VAE 压缩和高斯 CDP 均值估计。

    Rowan、Phan 与 Khisti 研究离散输入、连续输出信道的模拟:共享随机样本数固定,长块长用 polar 码与多层编码降到 O(n log n)。。信道模拟要让解码器的 Y 服从 P_{Y|X},同时把消息长度压向 I(X。

    深度解读完整解读