研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
- arXiv
- 2610.05453
- 发表
- 场景
- 模型与 API
- 被测模型
- OmniGen2、BAGEL-7B
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
组合偏好奖励与评分标准奖励后训练文生图模型以抑制奖励作弊
作者给出一套开放域文生图后训练配方:把人类偏好奖励和 prompt 条件的 rubric 奖励合在一起,而不是换一个新优化器。问题是单一奖励盖不住用户意图。偏好模型能看整体观感,但对“是否实现每个要求”这类稀疏属性不敏感。
这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。
提出 BadAction,通过动作触发器给交互式视频生成植入后门
提出 IDU,在无保留样本时蒸馏单步生成器并抑制遗忘子集
IDU 面向无条件 flow 与 score-based 教师,在蒸馏成单步生成器的同时做数据遗忘。
提出跨架构攻击 CSR,用概念分数参数重学习恢复文生图被擦除概念
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
提出针对 Agent Harness 的上下文特权提升攻击
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
用演化算法构造 mind virus 并测量其在多智能体中的传播
构建 ContextWeave,评测办公工作流智能体记忆的下游增益
ContextWeave 是面向语言智能体记忆的纵向基准,用来看召回先前经验能否让后续办公任务做得更好。
评测编码 Agent 记忆文件中提示注入的跨会话影响
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。