- 评测与基准arXiv 2610.06748
BazaarBench:评估 LLM Agent 在去中心化 C2C 市场中的代理安全
构建 BazaarBench 评测 C2C 市场中 Agent 的违规失信
- arXiv
- 2610.06748
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要论文提出挂钩底层资产的 C2C 交易评测基准,发现时间压力与对抗指令显著推高了智能体的违规承诺与欺诈行为。
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
- 评测与基准arXiv 2610.05586
AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测
用 AGENTDOXX 评测搜索 Agent 对匿名访谈的再识别
- arXiv
- 2610.05586
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击恶意使用
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
- 评测与基准arXiv 2604.02947
AgentHazard:评估计算机使用智能体有害行为的基准
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
- arXiv
- 2604.02947
- 发表
- 层
- 应用层
- 攻击恶意使用
摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
- 评测与基准arXiv 2608.29030
研究者提出自蒸馏方法让 LLM 遵循上下文水印指令
提出 SDLP 与 GRPO,训练模型遵循上下文水印指令
- arXiv
- 2608.29030
- 发表
- 场景
- 模型与 API
- 评测与基准arXiv 2609.06966
Mole:面向前沿实验室 AI 智能体的内部威胁检测基准
提出 MOLE 基准,评测监控器对智能体内部威胁的检出能力
- arXiv
- 2609.06966
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要MOLE 构建了智能体内部威胁检测基准,作者指出高漏检现状与推理痕迹的防御价值,并展示了监控策略优化空间。
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。
- 评测与基准arXiv 2609.09087
PrivEscalate:面向 LLM 自动化 Linux 提权的 531 场景基准与 PrivEscAgent 增强方案
构建 PrivEscalate 评测 Linux 提权并设计 PrivEscAgent
- arXiv
- 2609.09087
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击恶意使用
- 评测与基准arXiv 2609.33102
ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
- arXiv
- 2609.33102
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
- 评测与基准arXiv 2609.35028
VEX-Bench:评测 LLM 生成虚假信息的核验复杂度
提出 VEX-Bench 评测 LLM 生成虚假信息的核查复杂度
- arXiv
- 2609.35028
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击恶意使用
摘要VEX-Bench 用筛查时的五维复杂度衡量虚假信息对核查容量的占用,并报告生成与核查的成本差。
VEX-Bench 把 LLM 虚假信息的风险从“能否生成”改成“筛查时会占用多少核查容量”。
已经到底了