全部论文
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
- 评测与基准arXiv 2610.06748
BazaarBench:评估 LLM Agent 在去中心化 C2C 市场中的代理安全
构建 BazaarBench 评测 C2C 市场中 Agent 的违规失信
- arXiv
- 2610.06748
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要论文提出挂钩底层资产的 C2C 交易评测基准,发现时间压力与对抗指令显著推高了智能体的违规承诺与欺诈行为。
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
- 评测与基准arXiv 2604.02947
AgentHazard:评估计算机使用智能体有害行为的基准
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
- arXiv
- 2604.02947
- 发表
- 层
- 应用层
- 攻击恶意使用
摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
- 防御arXiv 2608.00716
生成图像更易被遗忘:面向合成图像检测的机器遗忘视角
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
- arXiv
- 2608.00716
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要作者用剪枝或 LoRA 遗忘拉开生成图与自然图的特征相似度,并在多个检测基准上报告结果。
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
- 防御arXiv 2609.27399
GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
- arXiv
- 2609.27399
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要GUARD 用门控激活转向把退出说话人推向冒充相似度,以抑制再识别并保住音质。
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
- 评测与基准arXiv 2609.06966
Mole:面向前沿实验室 AI 智能体的内部威胁检测基准
提出 MOLE 基准,评测监控器对智能体内部威胁的检出能力
- arXiv
- 2609.06966
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要MOLE 构建了智能体内部威胁检测基准,作者指出高漏检现状与推理痕迹的防御价值,并展示了监控策略优化空间。
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。
- 攻击arXiv 2609.15383
微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
- arXiv
- 2609.15383
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击者
- 黑盒
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
- 防御arXiv 2609.03629
EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除
提出 EraseSAE,在文生视频模型中局部擦除指定概念
- arXiv
- 2609.03629
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要EraseSAE 用单义特征局部擦除。
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
- 评测与基准arXiv 2609.33102
ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
- arXiv
- 2609.33102
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。