论文提出可审计的文本水印合规方案以落实欧盟 AI 法案第 50 条
把文本水印证据写成带错误率的三态可审计结论
- arXiv
- 2610.06317
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要把水印合规从普遍检测改成带范围的证据曲线、三态报告和再校准,模拟支持平方修正。
指定配置下的文本水印被做成可审计测量:记录证据如何衰减,并把检测收成三态,而不是判定人类作者身份。
把文本水印证据写成带错误率的三态可审计结论
指定配置下的文本水印被做成可审计测量:记录证据如何衰减,并把检测收成三态,而不是判定人类作者身份。
提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算
P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。
预测引导向量与 LoRA 权重,实现少样本作者风格迁移
在基座冻结、只有三篇摘要的冷启动下,生成符合特定作者文风的科学论文摘要。
提出 LS-AR,用潜向量经 FiLM 调节自回归解码以保持宏观目标
LS-AR 给因果解码器加一条不占窗口的连续目标通道,用来处理长程生成里宏观指令被挤出上下文或被注意力稀释的问题。
提出 HEST,用熵训练的双曲探针只在犹豫 token 引导隐状态
HEST 是不更新语言模型权重的推理时转向:模型自己的 next-token 熵既选出少数犹豫 token,也训练给出方向的双曲探针。要处理的情况是,数学解答里多数 token 已由上下文决定,分叉集中在高熵 token,而常见激活加法仍对每个 token 加同一欧氏向量。长推理模型上按关键词和步骤边界转向的做法,又很少适用于 instruction-tuned 模型。
证明随机谕示下谕示辅助计算无法零知识验证,签名谕示下则可
一般谕示辅助计算在随机谕示中做不到 witness hiding,因而也做不到零知识监督。给谕示答案加上数字签名后,抗碰撞哈希足以同时得到隐私和简洁验证。
摘要书评认为形成中的架构由多类行动者塑造,但没有共同计划。
提出容忍度公平性审计,用 CEL 认证违规并用 SEL 筛查
这篇工作给出一套按审计目标切换校准的容忍公平审计:差异不必为零,而是看预先指定的不利方向上是否超过允许阈值。
提出 k-ALeBi 偏差探针,主动审计黑盒模型的多组公平性
k-ALeBi 把黑盒多组公平审计写成跨组比较函数的学习,而不是先重构分类器。
提出 Mid-Harness,在执行前验证并选择终端智能体的候选动作
Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。
研究视觉语言模型在协作中能否表示并说出指称不确定性
摘要指称不确定性可被引出,但很少说出来。
提出列表式智能体补丁检索系统,在仓库中定位 CVE 修复提交
PatchHolmes 是面向补丁检索的两阶段系统:在本地 Git 仓库上用冻结开源权重模型,为一个已知 CVE 找出修复提交,不做按仓库微调,也不使用付费外部搜索 API。
提出 SelfSearch,用自我修改记录无奖励搜索改进编码智能体
TAIP 是放在未修改 RepoAudit 之外的保证层,用来在软件交付门上重算智能体安全控制的当前姿态。
形式化视频透视头显中系统截图与人眼视野的错配
提出双层自改进系统 AIDE2,让外层智能体重写内层 Harness 代码
摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。
提出 Djinnlang,以无歧义规格约束 LLM 的实现并由 Dafny 核验
Djinnlang 让程序员只写规格,把 LLM 放进编译器,并用 Dafny 验证器加上无歧义约束钉住语义。
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
提出多草稿水印投机采样 MPFR,同时保持无偏水印与采样效率
MPFR 是一种基于泊松过程的多草稿投机采样,用来同时提高解码效率并嵌入无偏水印。