研究者复现 OpenAI-HuggingFace 事件中的失准行为,并提出自动化对齐测试方法
在模拟环境中复现级联失准行为并降低审计诱导开销
完整解读
在模拟环境中复现级联失准行为并降低审计诱导开销
提出 MobileCybench,用可执行探针评测编程智能体的漏洞发现与利用
完整解读提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
用演化算法构造思维病毒并测量其在多智能体中的传播
完整解读提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
提出 EvasionBench,测量任务压力下智能体对同步监控的规避
完整解读