攻击arXiv 2609.38270
VirusCascade:劫持 LLM 推荐智能体的协同反思机制
提出 VirusCascade,劫持推荐智能体协同反思以定向推广物品
- arXiv
- 2609.38270
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- AgentCF、AgentRAG、AgentSEQ 等 8 个
另有 257 篇论文还没打上分类标签,暂不在筛选结果里。
提出 VirusCascade,劫持推荐智能体协同反思以定向推广物品
提出 UBA-ORL,借助 BD 与 CM 样本让离线强化学习后门在轨迹删除后激活
UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。
提出 CAVE-BENCH,评测虚假指责下智能体破坏已完成正确工作的行为
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。