分析与理论arXiv 2610.02886
研究揭示无触发投毒审计缺口:事实答对不等于决策正确
揭示无触发虚假训练下事实回答与下游决策的审计差距
- arXiv
- 2610.02886
- 发表
- 场景
- 模型与 API
- 测试
- Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 9 个
- 攻击投毒与后门
摘要作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
揭示无触发虚假训练下事实回答与下游决策的审计差距
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
提出预训练缩放律,估计野生 AI 网页文本相当于多少人类 token
作者测量未标注的 wild AI 网页文本对预训练的影响,并提出一个能让 AI token 价值变号的缩放律。
证明预训练投毒的清洁超额风险指数随极限顺序变化
可解的预训练数据投毒理论:清洁超额风险的缩放指数随极限顺序改变。。
分析近重复族如何让精确记录成员推断误判为入训
作者研究成员推断能否作为精确记录的数据来源证据。版权和来源审计需要的是该记录本身是否入训,而网页语料中的转载、镜像和轻改会让非同一近重复产生成员样分数。四世界审计用 E 表示精确记录是否入训、用 F 表示其近重复族是否在场,从而分开 H00 到 H10 的标准 MI、H00 到 H01 的族偏移,以及 H01 到 H11 的 exact-given-family。