跳到正文
10月9日 · 周五

Google DeepMind · 论文

找到 3 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 19 篇还没打标签,不在筛选结果里。

另有 19 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.31056

    SCALPEL:用对比稀疏自编码器实现选择性表征层遗忘

    提出 SCALPEL,用对比 SAE 在表征层选择性遗忘特定事实

    发表
    测试
    Qwen2.5-1.5B-Instruct、Llama-3.2-1B-Instruct、Gemma-2-2B-it
    摘要SCALPEL 以对比稀疏特征做窄目标表征遗忘,在 TOFU 上与优化基线相当且可检查。

    SCALPEL 是不改基座权重的表征层遗忘方法,面向与保留数据重叠的窄目标。

    深度解读完整解读
  2. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,延迟激活 Agent 的间接提示注入

    发表
    场景
    AI Agent
    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
已经到底了