跳到正文
10月10日 · 周六

全部论文

找到 15 篇

另有 244 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09793

    用时序逻辑监控工具 Agent

    提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链

    发表
    场景
    AI Agent
    攻击者
    黑盒
    摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。

    这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。

    深度解读完整解读
  2. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  3. 评测与基准arXiv 2610.06339

    BabelFake:面向多语言音视频 DeepFake 检测的基准数据集

    构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器

    发表
    被测模型
    SpeechForensics、AVH-Align、(B)RAVEn
    摘要BabelFake 为五语同意采集基准。

    BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。

    深度解读完整解读
  4. 防御arXiv 2610.05870

    MBZUAI 提出可校准的真实图像认证方法

    提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动

    发表
    攻击者
    白盒

    摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。

    深度解读完整解读
  5. 攻击arXiv 2609.39607

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器

    提出 PRETEXT 攻击,迭代改写技能文本绕过技能扫描器并让 Agent 执行木马

    发表
    场景
    AI Agent
    攻击者
    白盒
    被测模型
    glm (z-ai/glm-5.1)、qwen3t (qwen/qwen3-235b-a22b-thinking-2507)、gpt-oss (openai/gpt-oss-120b)
    摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。

    深度解读完整解读
  6. 防御arXiv 2609.34744

    现代图像后置水印信道的优化与安全:SNW 方案

    提出带密钥的 SNW,抵御事后图像水印的身份伪造

    发表
    被测模型
    SNW
    摘要SNW 用密钥与满秩各向同性投影提高事后水印的 Shannon 容量,并对 PCA 完全安全。

    Gesny 与 Giboulot 针对生成内容追溯所依赖的多比特事后图像水印,批评端到端 DNN 方案既无容量理论、又无密钥。

    深度解读完整解读
  7. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控

    发表
    场景
    AI Agent
    被测模型
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  8. 防御arXiv 2609.23586

    VidMark:面向视频生成模型知识产权保护的高效水印方案

    提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权

    发表
    被测模型
    Stable Video Diffusion (SVD)、Open-Sora、Wan
    摘要VidMark 加解码器引导微调,把模型签名写入 VGM 输出并用于两项核验。

    Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。

    深度解读完整解读
  9. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill,用跨技能组合绕过 Agent 技能扫描器

    发表
    攻击者
    黑盒、灰盒
    被测模型
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  10. 防御arXiv 2607.14737

    GeoDetect:面向视觉语言预训练模型的几何对抗检测方法

    提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本

    发表
    攻击者
    白盒
    被测模型
    CLIPViT (ViT-B/16)、CLIPCNN (ResNet-50)、ALBEF 等 4 个
    摘要GeoDetect 用几何分数检测 VLP 对抗样本。

    GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。

    深度解读完整解读
已经到底了