研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现
重评提示注入检测器,检验基准分数对智能体部署的预测力
完整解读
重评提示注入检测器,检验基准分数对智能体部署的预测力
用 MMPIBench 评测智能体框架的多模态提示注入
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。
构建多模态技能图像攻击基准 MMSkillRisk 并设计 NCVA