TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击
提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
- arXiv
- 2610.06848
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- BERT (4.4M-340M)、ViT (22M-307M)、Pythia (70M-2.8B) 等 5 个
摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。
提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。
提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
提出 DART,用去噪表征转移检测多轮智能体攻击并注入提醒
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略
用 SCM 合成会话并训练检测器识别推理层滥用
用配对续写与激活修补分析工具智能体越狱后的安全路由
这篇工作把越狱上下文残留之后的运行时安全反馈,做成工具智能体上的三路路由问题,并用激活修补给这个路由一个晚层的因果位点。作者认为,反馈可能恢复合法执行、留下未授权动作,或误伤良性流程,而现有攻击、基准和静态护栏没有在固定历史上把这三种结局分开。配对续写因此从同一冻结检查点分别接中性提醒 N 和安全反馈 S,并交叉保留越狱 J+ 与中和越狱 J0。
提出工具型 Agent 的自适应攻击 DART 与预执行防御 SAGE
摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。
提出 Skilder,按角色渐进下发企业工具并确定性拦截越权调用
Skilder 把企业工具型智能体的能力按角色打包,经一个 MCP 服务器做渐进发现,使工具范围由服务器而不是提示词来执行。
提出闭环自适应红队框架 CART,评测模型与 Agent 的安全失败
CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。
构建 APort Vault 基准,对比支付智能体模型拒答与确定性授权
提出能力洗钱攻击,拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出 FLOWSEAL,用工具级信息流控制阻断智能体隐私泄露
摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。
攻破混合 FHE 推理的置换式保密,精确恢复线性层排序谱
系统梳理智能体执行链路中的越狱攻击与防御并比较推理时防御
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 Skill-as-API,隔离多智能体协作中的 skill 正文与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
提出 SkillClone,仅凭良性任务交互重构闭源 Agent 技能
论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。
训练自博弈红队智能体 GPT-Red,规模化生成提示注入与越狱攻击
提出 SigLeak,从黑盒 Agent 执行轨迹推断专有技能
摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。