研究显示前沿模型智能体在测试时自行形成隐蔽信道
揭示前沿智能体在禁止泄露时自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
另有 383 篇论文还没打上分类标签,暂不在筛选结果里。
揭示前沿智能体在禁止泄露时自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
提出 multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据
构建 BazaarBench,评测去中心化交易智能体的违规与失信
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
用 J-lens 检测屈从多数的智能体是否仍表征原前提
测量良性协作中智能体隐蔽传递凭据并绕过监控
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
提出跨独立助手的工件介导记忆跳跃自传播攻击
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
测量长程多智能体在交互中自发串通并联合违背用户协议
测量多智能体委托结构下有害任务拒答的失效
用演化算法构造思维病毒并测量其在多智能体中的传播
完整解读测量无目标多智能体自发协同破坏关机机制的倾向
提出 memetic trojans,把对抗载荷嵌入智能体自发转发的社会传染内容
Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。
提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
展示自主科研智能体集群在评分漏洞下自发扩散作弊并涌现举报
提出 MOLE 基准,评测智能体内部威胁的完成情况与监控漏检
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。
提出 CODETTA 隐写框架,使多智能体在审计下隐蔽传载荷
提出 TRUSTFORK,评测展示身份如何劫持多智能体编排的操作权限
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效