论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆
提出eTAMP,通过网页注入跨会话污染Web智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
提出eTAMP,通过网页注入跨会话污染Web智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
提出无外部攻击模型的多轮自我越狱方法SLIP
提出Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
本文系统分析了真实世界 AI 智能体 Harness 上下文组装机制的安全性。
提出自博弈红队智能体GPT-Red,自动挖掘提示注入与越狱攻击
提出Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
提出任意字母置换密码越狱,无需微调即可诱导有害输出
提出生物红队模型Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
提出SceneJail,利用视频情境上下文越狱视频多模态模型
提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据