研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
完整解读
另有 383 篇论文还没打上分类标签,暂不在筛选结果里。
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
构建 THINKINGBOX 沙盒与基准,评测有状态业务工作流中智能体的执行稳定性
用 FairMedAgent 测量临床智能体在输入不变时的动作不稳定性下限
FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出 LongPIBench,评测长文档场景下的提示注入攻击与防御
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效