跳到正文
10月9日 · 周五

全部论文

找到 9 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 548 篇还没打标签,不在筛选结果里。

另有 548 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    测试
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B 等 4 个

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  2. 攻击arXiv 2610.06848

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员

    发表
    攻击者
    黑盒
    测试
    BERT (4.4M-340M)、ViT (22M-307M)、Pythia (70M-2.8B) 等 5 个

    摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。

    深度解读完整解读
  3. 其他arXiv 2610.01539

    研究者提出 AI 评估沙盒配置器,支持欧盟 AI 法案下的技术评估

    提出 AI 评估沙盒配置器,支撑监管沙盒多方技术评估与报告

    发表
    测试
    LLM-backed conversational assistant
    摘要框架把每次技术测试配成沙盒。

    AI Assessment Sandbox Configurator是面向欧盟 AIRS 中结构化技术测试的开源配置框架,用来按一次参与组装评估环境。

    深度解读完整解读
  4. 防御arXiv 2609.12378

    Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现

    提出端到端全同态加密方案 ODIN,在云端密文上完成推理以保护提示词

    发表
    测试
    Meta-Llama-3-8B、Llama-3-8B(THOR-style baseline)
    摘要ODIN 用可复用的特征主序打包和联合误差预算,在单张 H100 上完成 Llama-3-8B 的 CKKS 推理。

    ODIN 是面向 Llama 的服务器侧 CKKS 推理系统:客户加密提示词,诚实但好奇的服务器用明文权重在密文上算完 Llama-3,只返回结果密文。

    深度解读完整解读
  5. 其他arXiv 2609.16915

    ROSETTA:基于混合 CKKS/TFHE 的高效准确隐私保护 LLM 解码框架

    提出混合 CKKS/TFHE 的隐私保护 LLM 解码框架 ROSETTA

    发表
    测试
    GPT-2 Base、TinyLlama-1.1B、LLaMA-3-8B
    摘要ROSETTA 用分段 LUT 和 DAG 最短路,把 CKKS 与 TFHE 按算子拼进 LLM 解码。

    ROSETTA 是面向 LLM decode 的混合 CKKS/TFHE 隐私推理框架,目标是在 honest-but-curious 两方设定下,让服务器在密文上完成解码,同时保住权重和用户输入。

    深度解读完整解读
  6. 其他arXiv 2609.22978

    DeepSeek Elastic Compute(DSec):面向大规模智能体训练的高效沙箱基础设施

    提出沙箱平台 DSec,支撑大规模智能体训练的弹性隔离与状态恢复

    发表
    场景
    AI Agent
    摘要DSec 是面向大规模智能体 RL 的多后端生产沙箱,用分层、按需镜像和训练协同维持高密度。

    DSec 是 DeepSeek-AI 的生产沙箱平台,用来支撑从 DeepSeek V3.2 到 V4.1 的智能体 RL 与评测,而不是报告某个模型的任务准确率。

    深度解读完整解读
已经到底了