跳到正文

全部动态

今天新收录 51 条

第 5 页更新的内容回到最新

10月9日周五
  1. 论文追踪 · 收录 · 原文 论文51

    BreakFun:用模拟代码执行中的对象实例化越狱 LLM(原文,在新标签页打开)

    研究者提出 BreakFun 越狱方法,把有害请求包装成代码执行模拟:提示词给出一个无害的 Python 类定义即 Trojan Schema,要求模型回答这段代码运行会打印什么,模型必须实例化对象并为每个字段编造取值,而对抗性字段名把这些取值引向攻击目标,有害内容因此作为模拟实例化的副作用出现而非直接回答。

  2. 论文追踪 · 收录 · 原文 论文53

    研究:语法约束解码可越狱 LLM 生成恶意代码,并提出 CodeShield 防御(原文,在新标签页打开)

    提出 CodeSpear 越狱,借语法约束解码生成恶意代码,并给出 CodeShield 防御。

    推荐理由论文揭示语法约束解码本身可被用作越狱面,并给出配套的代码模态对齐方案,对部署代码生成服务的团队有直接参考价值。

  3. 论文追踪 · 收录 · 原文 论文57

    MOSAIC 框架利用 CLI 命令组合攻击编码 Agent,成功率 96.59%(原文,在新标签页打开)

    中山大学、山东大学、北京大学与香港科技大学的研究者提出 MOSAIC,用 CLI 安全知识库构造编码 Agent 的命令组合攻击。

    推荐理由论文提出 CLI 命令组合风险,用 CVE 与 PoC 蒸馏知识库生成攻击链,在五款编码 Agent 上给出成功率并测试五类防御。