论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
另有 31 篇论文还没打上分类标签,暂不在筛选结果里。
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
提出无外部攻击模型的多轮自我越狱方法 SLIP
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
完整解读提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
完整解读提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
完整解读提出任意字母置换密码越狱,无需微调即可诱导有害输出
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
完整解读提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件