全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 15 条- 会议论文ICML 2025
用调查员 Agent 诱发语言模型行为
训练摊销式 investigator 模型,搜索能诱发幻觉、有害回复等目标行为的提示,在 AdvBench 上攻击成功率 100%,幻觉诱发率 85%。
- 会议论文ICML 2025
攻击者可以滥用安全模型的组合
将恶意任务分解为子任务,分别交给最合适的模型,即使单个模型都安全,组合后也能更高比例地产出漏洞代码、黑客脚本等有害内容。
- 会议论文ICML 2025
用 GOAT 自动化红队:生成式攻击型测试 Agent
提出 GOAT,自动模拟多轮对话式对抗并组合 7 种攻击手法,在 JailbreakBench 上对 Llama 3.1 8B、70B 和 GPT-4o 的 ASR@10 分别达 96%、91%、94%。
- 会议论文ICML 2025
TRUST-VLM:对视觉语言模型安全威胁的全面红队测试
基于上下文学习并利用目标 VLM 反馈生成图文对抗测试用例,攻击成功率与用例多样性均优于传统红队方法。
- 会议论文ICML 2025
探究并缓解基于投票的排行榜被对抗操纵的问题
证明 Chatbot Arena 类榜单可被攻击者识别回复所属模型并约千票操纵排名,并与开发者合作实施缓解措施。
- 会议论文NeurIPS 2025
CoP:基于原则组合的 LLM 智能体红队测试
人类提供红队原则,AI 智能体自动编排策略生成越狱提示;对主流 LLM 将已知最佳单轮攻击成功率最高提升 19.0 倍。
- 会议论文NeurIPS 2025
VMDT:解码视频基础模型的可信性
提出首个视频模态可信性评测平台,覆盖安全、幻觉、公平、隐私与对抗鲁棒性;评测发现开源 T2V 模型普遍无法识别有害请求,且安全性与模型规模无关。
- 会议论文NeurIPS 2025
基于规则偏好建模的文生图系统红队测试
提出 RPG-RT,用 LLM 迭代改写提示并根据系统反馈微调,借助规则偏好建模适应未知防御,在 19 个 T2I 系统和 3 个商业 API 上验证有效。
- 会议论文NeurIPS 2025
留意 LLM 遗忘学习:隐藏风险与对策
揭示基于微调的遗忘学习可被恶意遗忘请求隐蔽破坏良性用户体验,并提出 Scope-aware Unlearning 增强鲁棒性。
- 会议论文NeurIPS 2025
PolyJuice:针对合成图像检测器的黑盒通用红队方法
利用文生图潜空间中检测器正误分类样本的分布偏移方向,黑盒、与图像无关地引导生成图像欺骗检测器,欺骗率最高达 84%,用其增强数据微调检测器可提升最多 30%。
- 会议论文NeurIPS 2025
SAGE-Eval:评测大模型对安全常识的系统性泛化
基于 104 条权威安全事实生成逾万场景,最佳模型 Claude-3.7-sonnet 仅通过 58%,且规模与表现相关性弱。
- 会议论文NeurIPS 2025
AutoRedTeamer:支持终身攻击集成的自主红队框架
双智能体框架可从风险类别出发自动生成并执行测试用例,并自主实现新攻击;在 HarmBench 上对 Llama-3.1-70B 攻击成功率高 20%,成本降低 46%。
- 会议论文USENIX Security 2025
分析 AI 脱衣应用生态
系统研究20个热门 AI 脱衣网站的定位、宣传功能与变现基础设施,为相关政策与技术讨论提供数据。
- 会议论文USENIX Security 2025
刻画 MrDeepFakes 性深度伪造交易市场
系统分析最大的性深度伪造市场的经济模式、受害目标与创作讨论,发现规则执行松散,并揭示此前未记录的攻击动机与资源获取手法。
- 会议论文USENIX Security 2025
从 Meme 到威胁:开源视觉语言模型的仇恨 Meme 理解与诱导仇恨内容生成
评估 7 个开源 VLM 对仇恨 meme 的理解,发现其缺乏有效拒答防护,易被滥用生成仇恨言论,部分输出被判定有害。