跳到正文
10月10日 · 周六

全部论文

找到 100 篇

另有 216 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.11766

    研究提出意图恢复率作为 LLM 安全评测的补充指标

    提出 IRIS,用意图恢复率区分遮蔽越狱下无害输出的原因

    发表
    被测模型
    GPT-4o、Claude Sonnet 4.5、Claude Opus 4.5 等 6 个
    摘要无害输出的证据权重取决于任务是否被恢复。

    IRIS 把意图恢复当作中间信号,用来解释意图遮蔽提示下为何没有出现有害协助。

    深度解读完整解读
  2. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  3. 评测与基准arXiv 2610.09033

    研究发布 ASRD 数据集,评测五款开源模型在非规范输入下的安全表现

    发表
    被测模型
    Gemma 2 9B、Gemma 3 4B、Llama 3.1 8B 等 6 个
    摘要五模型、七族表面形式的四态评测里,低有害遵从不等于读懂后的安全处理。

    ASRD 用四态标签检查五个开源模型如何处理非规范表面上的有害请求。

    深度解读完整解读
  4. 攻击arXiv 2610.07323

    ATLAS:用自适应信任域与主动学习搜索潜在对抗样本集

    提出 ATLAS 用水平集估计恢复黑盒分类器的对抗输入集合

    发表
    攻击者
    黑盒
    被测模型
    LeNet5、ResNet50 (CIFAR-10 standard)、ResNet50 (ImageNet standard) 等 5 个
    摘要ATLAS 用主动水平集估计构造黑盒对抗集,作者称其集合比单点攻击更具代表性。

    ATLAS 是一个查询式 black-box 框架,用来构造诱发失败的对抗输入集合,供鲁棒性审计使用。

    深度解读完整解读
  5. 攻击arXiv 2610.05943

    CRIME 框架利用良性 Agent 技能组合诱发恶意行为

    提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为

    发表
    场景
    AI Agent
    被测模型
    DeepSeek-V4-Flash、GPT-4o-mini、GPT-4o 等 6 个
    摘要良性技能经 DCA 或 ACA 组合后可产生恶意环境后果,单独审查对不上。

    CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。

    深度解读完整解读
  6. 攻击arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道

    发表
    场景
    AI Agent
    被测模型
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  7. 攻击arXiv 2610.02302

    研究者提出意图隐藏越狱的信息论框架,分析组合式攻击

    提出组合式意图隐藏越狱,按先验后验匹配选择辅助任务

    发表
    被测模型
    Qwen3-1.7B、Qwen3-4B、Qwen3-8B 等 7 个
    摘要用信息论选含目标的任务组合,再看查询能否既隐藏意图又让目标被执行。

    这篇工作把组合式意图隐藏写成任务选择:有害目标必须留在 bundle 里,同时让估计的有害意图概率贴近全集先验,或降到阈值以下。

    深度解读完整解读
  8. 攻击arXiv 2610.01768

    LLMLeak:借 LLM 合法网页抓取实施隐蔽数据外泄

    提出 LLMLeak,把机密编进报错 URL 借网页抓取外泄

    发表
    场景
    AI Agent
    摘要LLMLeak 用报错 URL 借聊天机器人抓取外传秘密。

    LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。

    深度解读完整解读
  9. 攻击arXiv 2610.01367

    研究:高质量数据筛选挡不住投毒

    提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本

    发表
    被测模型
    Llama2-7B-Chat、Llama3-8B-Instruct、Qwen2-7B-Instruct 等 5 个
    摘要质量筛选挡不住部分高分样本的安全削弱。

    Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。

    深度解读完整解读
  10. 攻击arXiv 2609.39607

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器

    提出 PRETEXT 攻击,迭代改写技能文本绕过技能扫描器并让 Agent 执行木马

    发表
    场景
    AI Agent
    攻击者
    白盒
    被测模型
    glm (z-ai/glm-5.1)、qwen3t (qwen/qwen3-235b-a22b-thinking-2507)、gpt-oss (openai/gpt-oss-120b)
    摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。

    深度解读完整解读
  11. 攻击arXiv 2609.39352

    研究者提出解耦铺垫与执行的 LLM Agent 技能投毒攻击

    提出 CoordPoison,解耦技能投毒的借口与动作

    发表
    被测模型
    DeepSeek-V4-Flash、GLM-5.3-Flash、Claude-Sonnet-4.6 等 5 个
    摘要CoordPoison 外置借口。

    CoordPoison 是一种 Skill 供应链投毒方法,把“为何执行”和“执行什么”拆到两个 Skill。。

    深度解读完整解读
  12. 攻击arXiv 2609.38253

    CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱

    提出 CollageAttack,用空间文本碎片重组越狱文生图模型

    发表
    攻击者
    黑盒
    被测模型
    GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro 等 5 个

    摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。

    深度解读完整解读
  13. 攻击arXiv 2609.36474

    FinRT:将自适应红队策略蒸馏为消费金融领域的可复用对抗生成器

    提出 FinRT,将消费金融自适应红队轨迹蒸馏为可复用对抗提示生成器

    发表
    攻击者
    黑盒
    被测模型
    Llama-3.3-70B、Llama-3.1-8B、Mixtral-8x7B 等 6 个
    摘要FinRT 用前向失效发现加校准代理 DPO,把消费金融红队收成单次前向生成器。

    FinRT 是面向消费金融的红队框架:先发现政策失效,再训练一个按政策、领域与目标行为出提示的生成器。

    深度解读完整解读