Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
另有 1065 篇论文还没打上分类标签,暂不在筛选结果里。
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读用 COPEX 基准在固定协议栈下评测智能体抵御 MCP 攻击的能力
完整解读提出 TPRS,量化工具命名等表征变化对智能体安全基准得分的影响
完整解读重评提示注入检测器,检验基准分数对智能体部署的预测力
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
用 MMPIBench 评测智能体框架的多模态提示注入
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出 OpenART 竞技场,用 EMHA 演化持久环境以评测智能体安全
完整解读评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出 LongPIBench,评测长文档场景下的提示注入攻击与防御
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
完整解读提出 CAVE-BENCH,评测智能体遭虚假指责后是否破坏已正确的工作
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测
提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差