跳到正文
10月9日 · 周五

全部论文

找到 17 篇

另有 480 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09793

    用时序逻辑监控工具 Agent

    提出 MFOTL 时序监控,用 MonPoly 检出工具 Agent 的危险动作链

    发表
    场景
    AI Agent
    测试
    GPT-4o、Sonnet-3.5
    摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。

    这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。

    深度解读完整解读
  2. 攻击arXiv 2610.01365

    ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

    提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联

    发表
    攻击者
    白盒、灰盒
    测试
    GPT-2 Small、GPT-2 Medium、GPT-2 Large 等 6 个

    摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。

    深度解读完整解读
  3. 评测与基准arXiv 2607.24177

    EXE-Bench:为真实可用性对 AI Windows 恶意软件检测器进行权衡排名

    提出 EXE-Bench 比较 Windows 恶意软件检测器的可用性权衡

    发表
    测试
    EmberGBDT、BBDnn、BBDnnFDRS 等 15 个
    摘要统一四指标后,手工特征的 EmberGBDT 综合居首,只看准确率会误导部署。

    EXE-Bench 用同一设置给 AI Windows 恶意软件检测器做四指标排序,而不是只比一次测试集准确率。。

    深度解读完整解读
  4. 防御arXiv 2609.08394

    Windows 恶意软件检测器作为复合 AI 系统:准确率、效率与对抗鲁棒性的权衡

    提出 OBELISK 三级流水线,权衡恶意软件检测的准确率、开销与鲁棒性

    发表
    攻击者
    白盒、黑盒
    测试
    GBDT-ALL、GBDT-YARA、NEBULA-ALL 等 5 个
    摘要三级过滤以不大的检测损失换速度,同一机制扩大攻击面,部署应按约束选配置。

    OBELISK 把 Windows PE 恶意软件检测做成 YARA、EMBER-GBDT 与 Nebula 的顺序流水线,用来同时看检出、计算开销和对抗鲁棒性。

    深度解读完整解读
  5. 防御arXiv 2608.06422

    CMU 研究:分片判断可避免 LLM 监督失效并抵御对抗利用

    提出分片监督,将评判标准分配给独立调用以抵御展示攻击

    发表
    攻击者
    黑盒
    测试
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Opus 4.6 等 5 个
    摘要论文揭示决策负载是大模型监督的独立瓶颈,提出分片与辩论机制有效分离注意力与平衡证据,在多项高难度基准上实现稳健评判。

    本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。

    深度解读完整解读
  6. 攻击arXiv 2609.19722

    ALIBI:向二进制注入虚假安全叙事可让 LLM 恶意软件分析器误判

    提出 ALIBI,向恶意二进制注入不执行掩护叙事使分析器误判为良性

    发表
    攻击者
    黑盒
    测试
    Gemini 2.5 Pro、GPT-5.5 Pro、Claude Opus 4.7 等 4 个
    摘要ALIBI 用二进制内的掩护叙事重释可疑静态证据,Gemini 上翻转多,另两模型主要为降级。

    ALIBI 是针对 LLM 恶意软件分诊的语义掩护叙事攻击:不覆盖系统指令,而把仍可见的可疑静态证据重释成良性安全产品的预期行为。

    深度解读完整解读
  7. 防御arXiv 2607.13716

    CAVA:面向智能体 AI 运行时治理的规范动作验证与证明

    提出 CAVA,将异构智能体动作规范为可哈希指纹并绑定审批回执

    发表
    场景
    AI Agent
    摘要CAVA 用规范动作指纹承接异构运行时治理。

    CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。

    深度解读完整解读
  8. 防御arXiv 2610.00209

    基于差分隐私扩散模型的能源时间序列插补:裁剪感知的目标条件化方法

    提出时间步感知目标条件化,改善差分隐私能源时序插补效用

    发表
    测试
    DiT-style Transformer、PatchTST、TimesNet 等 5 个
    摘要固定阈值 DP-SGD 下,v-prediction 加 ᾱt 加权降低能源时序插补误差,并降低后期低 SNR 的裁剪前梯度。

    作者研究固定阈值 DP-SGD 训练的扩散模型,如何在余弦调度的后期低 SNR 时间步避免 ε-prediction 产生易被裁剪的大梯度,从而做能源时序缺失值恢复。

    深度解读完整解读
  9. 防御arXiv 2609.37858

    存储不等于策略:面向 LLM 遗忘的状态条件支持控制

    提出 Intervention Score 与 DIR-R,按干预效果选择并修订遗忘参数支持

    发表
    测试
    Llama 3 8B、Gemma 2 2B、Qwen2.5-7B 等 4 个
    摘要作者把局部化遗忘拆成初始干预选择和检查点修订,并在三个设置里分别给证据和边界。

    Storage Is Not Strategy 研究局部化 LLM 遗忘里两个常被混在一起的决定:一开始该更新哪些参数,以及优化改变模型之后这个选择要不要改。

    深度解读完整解读
  10. 攻击arXiv 2609.27124

    Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习

    提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复

    发表
    攻击者
    灰盒
    测试
    CNN(MNIST:2 Conv + 3 FC)、CNN(Fashion-MNIST:6 Conv + 1 FC)、ResNet18(CIFAR-10)
    摘要Fed-ADR 用 gray-box 编排攻击绕过多种聚合防御,再用 Hessian 一致性检测和窗口内恢复把准确率拉回。

    Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。

    深度解读完整解读
  11. 防御arXiv 2609.36372

    TTMark:超越单 token 熵的成对无失真水印

    提出成对无失真水印 TTMARK,增强低熵下的机器文本检测

    发表
    测试
    Llama3.2-3B-Instruct、Mistral-v0.3-7B-Instruct、Qwen2.5-7B-Instruct 等 4 个
    摘要TTMARK 用水印化相邻 token 对利用条件熵,在多种无失真方案上提高检测并保持生成质量。

    TTMARK 是一种成对、无失真的文本水印:对相邻 token 的联合分布重加权,而不是逐 token 独立重加权。

    深度解读完整解读
  12. 防御arXiv 2609.14257

    DenMark:面向扩散语言模型的鲁棒语义水印

    提出 DenMark,在扩散语言模型去噪时注入可抵抗保义编辑的语义水印

    发表
    测试
    LLaDA-8B、LLaDA1.5-8B、LLaDA2.0-mini 等 8 个
    摘要DenMark 用 rollout 在 DLM 去噪中累积语义水印,扫描检测以抵抗保义编辑。

    DenMark 是面向扩散语言模型的语义水印:在去噪的局部更新里注入密钥相关语义信号,并在编辑改变 token 边界后仍检测。现有句子级语义水印要先完成整个语义单元再打分取舍,而 DLM 以任意顺序更新掩码,中间单元不完整。DenMark 把续写划成固定 token 区域,对每个局部候选做不提交的 rollout 补全,按语义分 gb 的平均选择更新,从而沿轨迹累积证据。

    深度解读完整解读
  13. 攻击arXiv 2609.33985

    研究:众包微调数据投毒可放大专有指令抽取

    提出主题锚点投毒,放大众包微调后的专有指令提取

    发表
    攻击者
    黑盒
    测试
    Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个

    摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。

    深度解读完整解读
已经到底了