防御arXiv 2610.01058·10月2日MOMAT:面向量化 LLM 低功耗越狱防御的多图集混合框架提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱arXiv2610.01058发表10月2日层提示层场景模型与 API防御检测与过滤攻击越狱组件护栏与评审+1+1深度解读完整解读
评测与基准arXiv 2609.39146·9月30日MADBench:多智能体辩论安全性评测基准发布发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响arXiv2609.39146发表9月30日层应用层场景多智能体攻击提示注入组件RAG+1+1摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。深度解读完整解读