跳到正文
10月9日 · 周五

全部论文

找到 73 篇
筛选5

另有 482 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2605.19847

    论文揭示多租户 RAG 账号合谋使隐私泄露随账号数线性增长

    提出零知识审计协议,核验多租户 RAG 的合谋差分隐私

    发表
    测试
    MultiTenantRAGService、FAISS、HNSW (M=64, efcstr=200, efq=128) 等 4 个
    摘要揭示多租户 RAG 合谋泄露按根号 k 放大,提出带零知识证明的无泄露审计协议。

    论文针对多租户 RAG 服务在多账户协同攻击下隐私边界失效的问题展开研究。

    深度解读完整解读
  2. 攻击arXiv 2607.03968

    研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容

    提出工作流级越狱构建,经多轮开发工作流诱导编程 Agent 在代码中写出有害内容

    发表
    攻击者
    黑盒、无盒
    测试
    Claude Sonnet 4.6、Claude Haiku 4.5、Gemini 3.1 Pro 等 5 个

    摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。

    深度解读完整解读
  3. 攻击arXiv 2608.04192

    研究者提出 SkillClone,仅凭正常提问即可克隆 LLM Agent 隐藏技能功能

    提出 SKILLCLONE,仅凭良性任务交互重构 Agent 隐藏技能功能

    发表
    场景
    AI Agent
    攻击者
    黑盒
    测试
    DeepSeek-Flash、DeepSeek-Pro、GLM-5.1 等 6 个
    摘要论文揭示了仅靠良性任务交互即可重构闭源智能体技能隐藏功能的风险,表明功能保密需要限制累积信息泄露。

    论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。

    深度解读完整解读
  4. 评测与基准arXiv 2610.10276

    PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤

    提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤

    发表
    测试
    Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it 等 8 个

    摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。

    深度解读完整解读
  5. 攻击arXiv 2610.05894

    研究者提出闭环偏见注入攻击

    提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见

    发表
    攻击者
    灰盒
    测试
    LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct

    摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    深度解读完整解读
  6. 攻击arXiv 2610.03124

    研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效

    提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测

    发表
    攻击者
    黑盒、白盒
    测试
    Llama2 (7B)、Llama3 (8B)、Qwen2.5 (7B)
    摘要作者用 UNTAG 评估 trigger-tag,认为其不能充当开放权重滥用检测的主要边界。

    UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。

    深度解读完整解读
  7. 攻击arXiv 2606.09084

    研究者提出 Context-Fractured Decomposition 攻击

    提出 CFD,跨会话拆解有害目标以绕过工具智能体本地监控

    发表
    场景
    AI Agent
    测试
    GPT-4.1、GPT-5-nano、Claude-3.5-Sonnet 等 6 个
    摘要CFD 用无指令 artifact 把越狱拆到跨会话。

    CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。

    深度解读完整解读
  8. 攻击arXiv 2607.25560

    SigLeak 可从执行轨迹推断专有 Agent 技能

    提出 SigLeak,从良性查询的执行轨迹推断专有 Agent 技能

    发表
    场景
    AI Agent
    攻击者
    黑盒
    测试
    GPT-5.4-mini、GPT-5.5、GLM-5.2 等 4 个

    摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。

    深度解读完整解读
  9. 防御arXiv 2608.05578

    AMS 工具通过激活分析检测语言模型的安全训练改动

    提出 AMS,用激活分离与方向相似度检测安全训练改动

    发表
    测试
    Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct、Llama-3.2-1B-Instruct 等 14 个
    摘要AMS 按激活签名把安全改动分四类,前三类可由两级扫描覆盖,行为微调会漏。

    AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。

    深度解读完整解读
  10. 评测与基准arXiv 2608.20554

    aiXamine:跨维度评测 LLM 安全、安全(security)与隐私权衡

    提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡

    发表
    测试
    openai/gpt-5-mini、openai/gpt-4o、anthropic/claude-haiku-4.5 等 15 个
    摘要aiXamine 用九服务黑盒协议比较百余个模型,作者称单轴信任度进展可能削弱其他轴。

    aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。

    深度解读完整解读