ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
完整解读
另有 1065 篇论文还没打上分类标签,暂不在筛选结果里。
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
揭示拆分训练返回梯度以零支撑暴露诱饵行并泄露训练内容
这是一项关于双节点大语言模型拆分训练系统的系统安全案例研究,揭示了评估工具遗漏反向信道所导致的静默隐私失效。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
完整解读提出参考嫁接,在推理时用激活干预诱导出沙袋隐藏的能力