EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
另有 31 篇论文还没打上分类标签,暂不在筛选结果里。
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
在模拟环境中复现级联失准行为并降低审计诱导开销
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
评测自主模型受挫时是否对范围外目标发动供应链攻击
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。
提出 EvasionBench,测量任务压力下智能体对同步监控的规避
完整解读