跳到正文
10月10日 · 周六

全部论文

找到 4 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.04192

    研究者提出 SkillClone,仅凭正常提问即可克隆 LLM Agent 隐藏技能功能

    提出 SkillClone,仅凭良性任务交互重构闭源 Agent 技能

    发表
    场景
    AI Agent
    攻击者
    黑盒
    被测模型
    DeepSeek-Flash、DeepSeek-Pro、GLM-5.1 等 5 个
    摘要论文揭示了仅靠良性任务交互即可重构闭源智能体技能隐藏功能的风险,表明功能保密需要限制累积信息泄露。

    论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。

    深度解读完整解读
  2. 攻击arXiv 2607.25560

    SigLeak 可从执行轨迹推断专有 Agent 技能

    提出 SigLeak,从黑盒 Agent 执行轨迹推断专有技能

    发表
    场景
    AI Agent
    攻击者
    黑盒
    被测模型
    GPT-5.4-mini、GPT-5.5、GLM-5.2 等 4 个

    摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。

    深度解读完整解读
  3. 攻击arXiv 2508.06837

    Prometheus:针对文生图扩散模型的免训练提示词窃取攻击

    提出 Prometheus,从展示图反推文生图模型的在售提示词

    发表
    被测模型
    Midjourney、Leonardo.ai、DALL·E 等 4 个
    摘要训练无关的 proxy 搜索攻击。

    Prometheus 是针对文生图市场 showcase 的训练无关提示词窃取:攻击者看不到在售文本,只用本地开源 proxy 恢复 subject 和 modifier,并希望换 subject 后风格仍在。

    深度解读完整解读
已经到底了