分析与理论arXiv 2610.00417
研究:合成数据溯源识别在改写后准确率大幅下降
检验合成数据来源识别是否等于再训练适配筛选
- arXiv
- 2610.00417
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Qwen2.5-3B-Instruct、DistilRoBERTa、word TF-IDF logistic regression 等 5 个
摘要来源识别在原文上准确,改写后精确归因下降。
作者在金融风险文本上把来源识别和训练样本是否有用拆成两次测量,并写明这不是电信部署实验。
检验合成数据来源识别是否等于再训练适配筛选
作者在金融风险文本上把来源识别和训练样本是否有用拆成两次测量,并写明这不是电信部署实验。
比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何
作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
摘要作者称检测靠分散的词法线索。