跳到正文
10月9日 · 周五

全部论文

找到 26 篇

另有 519 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.12292

    论文提出选项通道攻击:改一个选项标签即可让 Agent 护栏放行违规操作

    提出选项通道攻击,重命名选项标签使 Agent 护栏放行违规操作

    发表
    攻击者
    黑盒
    被测模型
    LAYA-TD、LAYA-EN、LAYA-ML 等 5 个

    摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。

    深度解读完整解读
  2. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  3. 防御arXiv 2610.05870

    MBZUAI 提出可校准的真实图像认证方法

    提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动

    发表
    攻击者
    白盒

    摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。

    深度解读完整解读
  4. 攻击arXiv 2610.03124

    研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效

    提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测

    发表
    攻击者
    黑盒、白盒
    被测模型
    Llama2 (7B)、Llama3 (8B)、Qwen2.5 (7B)
    摘要作者用 UNTAG 评估 trigger-tag,认为其不能充当开放权重滥用检测的主要边界。

    UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。

    深度解读完整解读
  5. 防御arXiv 2609.36372

    TTMark:超越单 token 熵的成对无失真水印

    提出成对无失真水印 TTMARK,增强低熵下的机器文本检测

    发表
    被测模型
    Llama3.2-3B-Instruct、Mistral-v0.3-7B-Instruct、Qwen2.5-7B-Instruct
    摘要TTMARK 用水印化相邻 token 对利用条件熵,在多种无失真方案上提高检测并保持生成质量。

    TTMARK 是一种成对、无失真的文本水印:对相邻 token 的联合分布重加权,而不是逐 token 独立重加权。

    深度解读完整解读
  6. 防御arXiv 2609.34744

    现代图像后置水印信道的优化与安全:SNW 方案

    提出带密钥的 SNW,抵御事后图像水印的身份伪造

    发表
    被测模型
    SNW
    摘要SNW 用密钥与满秩各向同性投影提高事后水印的 Shannon 容量,并对 PCA 完全安全。

    Gesny 与 Giboulot 针对生成内容追溯所依赖的多比特事后图像水印,批评端到端 DNN 方案既无容量理论、又无密钥。

    深度解读完整解读
  7. 防御arXiv 2609.23586

    VidMark:面向视频生成模型知识产权保护的高效水印方案

    提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权

    发表
    被测模型
    Stable Video Diffusion (SVD)、Open-Sora、Wan
    摘要VidMark 加解码器引导微调,把模型签名写入 VGM 输出并用于两项核验。

    Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。

    深度解读完整解读
  8. 攻击arXiv 2609.19722

    ALIBI:向二进制注入虚假安全叙事可让 LLM 恶意软件分析器误判

    提出 ALIBI,向恶意二进制注入不执行掩护叙事使分析器误判为良性

    发表
    攻击者
    黑盒
    被测模型
    Gemini 2.5 Pro、GPT-5.5 Pro、Claude Opus 4.7
    摘要ALIBI 用二进制内的掩护叙事重释可疑静态证据,Gemini 上翻转多,另两模型主要为降级。

    ALIBI 是针对 LLM 恶意软件分诊的语义掩护叙事攻击:不覆盖系统指令,而把仍可见的可疑静态证据重释成良性安全产品的预期行为。

    深度解读完整解读
  9. 防御arXiv 2609.14257

    DenMark:面向扩散语言模型的鲁棒语义水印

    提出 DenMark,在扩散语言模型去噪时注入可抵抗保义编辑的语义水印

    发表
    被测模型
    LLaDA-8B、LLaDA1.5-8B、LLaDA2.0-mini 等 4 个
    摘要DenMark 用 rollout 在 DLM 去噪中累积语义水印,扫描检测以抵抗保义编辑。

    DenMark 是面向扩散语言模型的语义水印:在去噪的局部更新里注入密钥相关语义信号,并在编辑改变 token 边界后仍检测。现有句子级语义水印要先完成整个语义单元再打分取舍,而 DLM 以任意顺序更新掩码,中间单元不完整。DenMark 把续写划成固定 token 区域,对每个局部候选做不提交的 rollout 补全,按语义分 gb 的平均选择更新,从而沿轨迹累积证据。

    深度解读完整解读
  10. 防御arXiv 2609.08394

    Windows 恶意软件检测器作为复合 AI 系统:准确率、效率与对抗鲁棒性的权衡

    提出 OBELISK 三级流水线,权衡恶意软件检测的准确率、开销与鲁棒性

    发表
    攻击者
    白盒、黑盒
    被测模型
    GBDT-ALL、GBDT-YARA、NEBULA-ALL 等 4 个
    摘要三级过滤以不大的检测损失换速度,同一机制扩大攻击面,部署应按约束选配置。

    OBELISK 把 Windows PE 恶意软件检测做成 YARA、EMBER-GBDT 与 Nebula 的顺序流水线,用来同时看检出、计算开销和对抗鲁棒性。

    深度解读完整解读
  11. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill,用跨技能组合绕过 Agent 技能扫描器

    发表
    攻击者
    黑盒、灰盒
    被测模型
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读