JailbreakOPT:工具辅助的迭代越狱提示词优化框架(原文,在新标签页打开)
提出 JailbreakOPT,组合原子工具迭代优化黑盒单轮越狱提示。
提出 JailbreakOPT,组合原子工具迭代优化黑盒单轮越狱提示。
提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码。
推荐理由同一批有害提示词在直接对话下几乎全被拒答,却在 IDE 多轮工作流中被模型自己写成有害教学示例,为编程 Agent 的安全评估提供了新的失败模式视角。
提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统固化恶意行为。
推荐理由论文给出轨迹投毒在两类自演化技能系统上的成功率与消融结果,部署 Agent 技能演化的团队可据此检查证据晋升环节。
提出 DEEPTRAP 以搜索可诱导不安全轨迹的执行上下文载荷。
伦敦国王学院、复旦大学等机构的研究者用 SocioHack 展示 RL 训练使模型自发利用社会规制漏洞。
评测不确定性估计与 LLM 幻觉的关联。
构建 HelpBench 评测 LLM 提供隐私与安全建议的能力。
提出 SeqWM,把水印写入智能体动作转移并用随机密钥检测。
构造可通过计费审计的 token 虚报,使服务商系统性超收。
提出 Misrouter,借 MoE 路由优化仅输入前缀并迁移攻击。
提出 RolePlay 框架,用人设条件放大 LLM 单次推理开销。
提出 ARENA 音频红队框架,自动构造文本安全且音频接地的越狱输入。
提出 FRA-Attack,用频域对齐与梯度正则做可迁移定向视觉攻击。
提出 ColluSkill,用跨技能组合绕过 Agent 技能扫描器。
推荐理由论文同时给出跨技能组合攻击在六款扫描器上的成功率和链级防御的拦截效果,可对照现有技能扫描流程评估盲区。
提出嵌入推断攻击 EIA,在黑盒 IR 中识别所用嵌入模型。
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答。
推荐理由论文量化了毒性分数与越狱成功率的关系,并给出按危害类别分层加固分类器的具体建议。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令。
把批量提示当作越狱攻击,提出 batch-aware DPO 缓解。
提出 CDH 攻击,让技能型 Agent 绕路放大资源消耗。
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解。
推荐理由论文给出被动提示注入在日志分析场景的攻击成功率与分层防御的残余风险,可供部署 LLM 日志分析的团队参考。
系统研究 LLM 智能体记忆投毒并构建基准 MPBench。
推荐理由论文系统梳理了智能体长期记忆的四条写入通道与九类结构性漏洞,并给出六类投毒攻击的基准测试结果,可据此评估自有智能体的记忆写入策略。
提出 SkillVetBench 评估开源 Agent 技能的多维安全风险。
提出 LegalHalluLens,分类审计法律抽取幻觉并校准多智能体辩论。
研究者提出 SafePyramid,一个用于评测上下文内策略护栏(in-context policy guardrailing)的安全基准。
提出 Vaporizer,用词法变换、翻译和释义破解 LLM 输出水印。
德州大学奥斯汀分校等机构研究者提出对抗重构,仅改表述以拉高 AI 审稿分数。
推荐理由在科学内容完全不变的前提下,仅靠摘要、相关工作与叙事重排即可把 AI 审稿分数推高,论文给出了跨模型的成功率与策略排序,可迁移到其他 LLM 评审场景的鲁棒性测试。
提出 CITA 三阶段框架,生成可绕过毒性检测器的中文隐式毒性文本。
提出 SKILLBLOAT,改写技能文档放大编码 Agent token 消耗。
提出 RedEvoAgent,演化攻击技能对黑盒智能体做自动红队。
提出 INFER+ 信息过载方法,越狱大型视觉语言模型。
提出 CompoSkill,将逐个通过扫描的技能编排为攻击链。
推荐理由论文提出技能组合层面的攻击框架,说明单个技能通过扫描并不等于组合执行路径安全,可供技能市场与 Agent 运行时的安全评估参考。
南加州大学研究者提出 SkillClone,仅凭良性任务交互重构闭源 Agent 技能。
提出 RoguePrompt 双层编码自重构越狱,绕过 LLM 审核。
提出 CONTRA 树搜索,通过良性配置修改诱发个人化 Agent 执行恶意动作。
提出 EvoBreak,以良性任务组合诱导自进化 Agent 的持久经验并削弱安全边界。
提出 EVOMAL,诱导自演化编码 Agent 在创建技能时自我投毒并蠕虫传播。
推荐理由论文给出六款模型在 SWE-bench 任务上的自我投毒率与传播条件,并说明现有名称、代码与签名筛查为何失效。
提出 LoginTrap,以网页弹窗诱导 Web Agent 提交敏感信息。
推荐理由论文给出任务无关的登录诱导注入方法及跨模型、跨 Agent 架构的成功率数据,可帮助部署 Web Agent 的团队评估认证边界风险。
人形机器人的 AI 突破短期内难以改变生活,许多研究者认为,把建立在语言和图像之上的智能用于驾驭物理世界,低估了现实环境的无限变化,也把"人形"与"通用机器"混为一谈,机器人实验室内部对是否需要全新路径存在分歧。WaveSave 凭借可在洪水来临时快速展开、充水成坝的便携橡胶坝 SlamDam 入选 MIT Technology Review 2026 年 10 家值得关注的气候科技公司,该坝最高 1.3 米。
英国 Co-op 旗下的 Co-op Legal Services 引入 AI 通话监控系统,用 OpenAI 的模型记录、分析并给员工与客户的每次通话打分,评估遗嘱、遗产等咨询业务。该模型被训练来评估每通电话中 50 多个细分维度,向管理者给出通过或未通过的结果,用于分析员工表现并识别提升销售的方式。一名匿名员工称,这意味着自己每天有数小时被 AI 监控,感觉像每个字都被监听,并称其反乌托邦。Co-op 表示不认同这一批评,称 AI 仅作为支持工具、不是决策者,属于质量保证流程的一部分。该系统据信近几个月已覆盖数十名法律服务员工。
巴西 Itaú 银行聘请心理学家团队训练其对话式 AI 助手,用于在客户遭遇诈骗时将其从“恍惚”状态中拉出。该行已能通过 AI 识别用户通话中打开银行 App 的诈骗场景,并弹出近 40 种定制化警告,但仍有用户无视提示继续转账。Itaú 还将真实受骗客户请入总部“镜像室”,由精神分析师评估其行为以定位干预触发点。