研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现
重评提示注入检测器,检验基准分数对智能体部署的预测力
完整解读
重评提示注入检测器,检验基准分数对智能体部署的预测力
构建 THINKINGBOX 沙盒与基准,评测有状态业务工作流中智能体的执行稳定性
提出 MobileCybench,用可执行探针评测编程智能体的漏洞发现与利用
完整解读重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳
这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。
用 FairMedAgent 测量临床智能体在输入不变时的动作不稳定性下限
FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。。