Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
另有 383 篇论文还没打上分类标签,暂不在筛选结果里。
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
完整解读评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出 CAVE-BENCH,评测智能体遭虚假指责后是否破坏已正确的工作
提出 TRUSTFORK,评测展示身份如何劫持多智能体编排的操作权限
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效