全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
中文短视频虚假信息中的多模态大模型认知偏差评测
基于200条健康短视频评测八个多模态大模型,发现模型识别虚假信息的表现差异明显,且易受权威账号标识等社会线索误导。
- 会议论文ACL 2026
FinSafetyBench:真实金融场景下的大模型安全评测
构建覆盖14类金融犯罪与伦理违规的中英双语红队基准,发现模型在中文场景更易受攻击,提示级防御难以应对隐蔽操纵。
- 会议论文ACL 2026
AgenticEval:智能体驱动的自演化大模型安全评测
利用多智能体从政策文档生成并迭代安全测试,随测试强化,GPT-5在欧盟AI法案相关评测中的安全率从72.50%降至36.36%。
- 会议论文ACL 2026
JailMeter:基于证据的大模型越狱攻击评估框架
从回答中提取与恶意意图相关的证据,评估越狱是否实质成功,在330个人工标注样本上准确率达97.27%。
- 会议论文ACL 2026
逆向宪法式AI:通过概率截断实现可控有害数据生成
通过反转无害原则与批评修订流程生成红队数据,概率截断使语义连贯性提升15%,同时保持对抗强度。
- 会议论文ACL 2026
MTMCS-Bench:多模态模型多轮对话情境安全评测
构建逾三万条样本评测多轮情境安全,发现模型常漏判渐进风险或过度拒答,现有护栏也未能完全解决这些问题。
- 会议论文ICLR 2026
基于能力的大模型红队测试标度律趋势
通过评估逾600对攻击者与目标模型,揭示红队越狱成功率受两者能力差距主导并提出越狱标度曲线,指出固定能力的测试者面对更强模型时可能失效。
- 会议论文ICLR 2026
面向红队攻击的树结构对话强化策略优化
提出结合强化学习与树搜索的DialTree框架,将对话建模为序列决策问题,无需人工标注即可自主发现多轮攻击策略,大幅提升红队攻击成功率。
- 会议论文ICLR 2026
RedCodeAgent:针对多种代码 Agent 的自动化红队 Agent
带自适应记忆模块的红队 Agent,可选择并组合越狱工具,并用沙箱评估执行结果;攻击成功率优于现有方法,并在 Cursor、Codeium 上发现了此前未知的风险。
- 会议论文ICLR 2026
Auto-RT:用于大语言模型红队测试的自动越狱策略探索
提出强化学习框架Auto-RT,引入动态策略剪枝与渐进式奖励追踪,自主探索越狱策略以提升漏洞覆盖率与发现速度。
- 会议论文ICLR 2026
STAR:策略驱动的大语言模型自动化越狱红队测试
提出STAR黑盒自动化红队测试框架,将越狱策略探索转移至潜在激活空间,通过提取和重组策略主成分生成多样化越狱提示词,显著提升攻击成功率。
- 会议论文ICLR 2026
CAGE:跨文化自适应红队基准生成框架
提出CAGE框架以解耦对抗结构与文化内容,自适应生成契合当地文化与法律的红队测试基准,构建的韩语基准能更有效发现模型漏洞。
- 会议论文ICLR 2026
ARMs:面向多模态模型的即插即用自适应红队智能体
提出自适应红队智能体ARMs,结合多步编排与分层记忆自动化生成攻击策略,并构建了包含3万条用例的多模态安全基准ARMs-Bench。
- 会议论文ICLR 2026
SocialHarmBench:揭示大语言模型在社会危害请求下的脆弱性
构建包含585个多国真实事件提示的基准SocialHarmBench,对抗性评测开源模型在威权监控、虚假宣传等高风险社会政治领域的鲁棒性与防护失效。
- 会议论文ICLR 2026
你的大模型有多危险?多轮对话中灾难性风险的统计认证
提出C3LLM框架,通过将多轮对话建模为查询图上的马尔可夫过程,以统计保证量化前沿模型生成灾难性响应的概率下界,揭示了显著的安全风险。
- 会议论文ICML 2026
REALISTA:诱发 LLM 幻觉的真实潜空间对抗攻击
将幻觉诱发表述为约束优化,在潜空间用语义等价改写方向的组合构造对抗提示,在开源 LLM 上优于或持平现有方法,并能攻击大型推理模型。
- 会议论文ICML 2026
RedDebate:通过多智能体红队辩论实现更安全的模型响应
提出首个结合多智能体辩论与全自动红队的RedDebate框架,通过模型相互辩论系统发现不安全失效模式,并结合长期记忆模块持续减少有害输出。
- 会议论文ICML 2026
当搜索出错:网络增强大语言模型的红队测试
提出红队测试框架CREST-Search及有害数据集,通过生成看似良性的搜索查询诱导模型产生不安全引用,揭示了网络增强大模型系统的安全脆弱性。
- 会议论文ICML 2026
FLARE-AI:面向人工智能的缺陷报告系统
针对AI安全缺陷报告碎片化问题,提出开源缺陷报告系统FLARE-AI,通过标准化分流与跨组织共享,降低报告门槛并加速漏洞修复。
- 会议论文ICML 2026
主动攻击:通过自适应环境对大语言模型进行红队测试
该研究提出强化学习红队算法Active Attacks,通过随被测模型演化周期性安全微调构建由易到难的课程,将多样化有害提示词的攻击成功率提升了数百倍。
- 会议论文ICML 2026
FoeGlass:简单的上下文学习即可对音频深伪检测器做红队测试
提出首个针对音频深伪检测器的黑盒自动红队方法,用 LLM 上下文学习探索 TTS 输入空间,漏检率最高提升 94%,攻击可迁移,微调后检测器鲁棒性提升至多 41%。
- 会议论文ICML 2026
估计语言模型输出分布中的尾部风险
用构造不安全版本模型做重要性采样,估计有害输出概率,样本量比暴力蒙特卡洛少 10–20 倍,可预测部署风险。
- 会议论文ICML 2026
STARE:多模态毒性攻击的分步时序对齐与红队引擎
提出分步时序对齐红队框架STARE,利用分层强化学习优化去噪轨迹触发毒性输出,大幅提升攻击成功率并揭示毒性生成的阶段性规律。
- 会议论文ICML 2026
Stable-GFlowNet:基于对比轨迹平衡的多样且鲁棒的大模型红队测试
针对大模型红队测试中生成流网络训练不稳定和模式崩塌问题,提出消除配分函数估计的S-GFN方法,显著提升了红队攻击的有效性与生成多样性。