跳到正文
10月10日 · 周六

全部论文

找到 20 篇

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.07939

    CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出

    提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别

    发表
    被测模型
    C2P-CLIP、ForgeLens、D3-Im 等 10 个

    摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。

    深度解读完整解读
  2. 防御arXiv 2610.07657

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击

    发表
    被测模型
    Qwen3-235B-A22B-Instruct-2507、gpt-oss-120b、Llama-4-Scout-17B-16E-Instruct 等 5 个
    摘要DEFER 把确定性检查放在 judge 之前。

    DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。

    深度解读完整解读
  3. 评测与基准arXiv 2610.06339

    BabelFake:面向多语言音视频 DeepFake 检测的基准数据集

    构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器

    发表
    被测模型
    SpeechForensics、AVH-Align、(B)RAVEn
    摘要BabelFake 为五语同意采集基准。

    BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。

    深度解读完整解读
  4. 评测与基准arXiv 2609.39473

    FAME:用反事实推理评测自主智能体的虚假记忆

    提出 FAME,用反事实概念漂移评测智能体虚假记忆

    发表
    被测模型
    Llama-3B
    摘要FAME 用反事实引起的隐状态概念漂移,在出答案前区分忠实记忆与虚假记忆。

    FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。

    深度解读完整解读
  5. 防御arXiv 2609.17648

    多智能体 LLM 流水线中的信任传播与结构隔离

    用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行

    发表
    被测模型
    gemma4:31b-cloud
    摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。

    作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。

    深度解读完整解读
  6. 评测与基准arXiv 2609.17320

    Emergence World:对长时程多智能体系统开展对抗压力测试

    提出 Emergence World,对长时程多智能体系统开展对抗压力测试

    发表
    被测模型
    Claude Opus 4.8、DeepSeek v4 Pro、Gemini 3.5 Flash 等 9 个

    摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    深度解读完整解读
  7. 其他arXiv 2609.10144

    AIOS 的内核管理共享内存:面向系统级个性化的新抽象

    提出内核管理共享记忆抽象,统一多智能体的检索、隐私过滤与注入

    发表
    被测模型
    GPT-4o、Llama-3.1:8B、Qwen-2.5:7B
    摘要作者称内核集中管理记忆,能拿到无约束上下文的大部分个性化收益,并降低延迟。

    kernel-managed shared memory 把多智能体的检索、隐私和注入收进 agent-system kernel,并在 AIOS 上与三种替代方案比较。

    深度解读完整解读
  8. 防御arXiv 2608.18607

    VA-Judger:面向联合视频-音频生成的人类偏好反馈奖励建模

    提出 VA-Judger,用人类偏好训练联合音视频奖励模型

    发表
    被测模型
    VA-Judger、LTX-2 + VA-Judger
    摘要VA-Judger 用易到难的人类偏好学习做联合音视频奖励,并用于 LTX-2 后训练。

    VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。

    深度解读完整解读
  9. 多智能体协同过滤系统的连接性攻击与防御研究

    复现 AgentCF 上的多智能体攻防并刻画连通性作用

    发表
    被测模型
    Qwen3-235B-A22B、Claude Haiku 4.5、Mixtral 8×7B 等 4 个
    摘要连通性沿 k 与ρ改变攻防,且用户/物品与早期/稳态需要分开看。

    作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。

    深度解读完整解读
  10. 防御arXiv 2607.13336

    TC-UAP:针对图像转视频与微调定制的通用视频保护方法

    提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份

    发表
    被测模型
    LTX-2.3、Wan2.2-5B
    摘要TC-UAP 以可复用的时间一致扰动干扰两类定制共用的 VAE 隐空间。

    作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。

    深度解读完整解读
  11. 评测与基准arXiv 2605.18984

    Artifact-Bench:评估 MLLM 检测与诊断 AI 生成视频伪影

    提出 Artifact-Bench,评测 MLLM 检测并诊断 AI 生成视频伪影

    发表
    被测模型
    Gemini 3.1 Pro、Gemini 3 Flash、Qwen3-VL 8B-Instruct 等 19 个
    摘要Artifact-Bench 以三项任务评 MLLM 的 AIGC 伪影感知。

    Artifact-Bench 用来看 MLLM 能否发现 AI 生成视频中的伪影,并说明视频为何不真实。

    深度解读完整解读
  12. 攻击arXiv 2605.08460

    论文建模多智能体网络中的子智能体继承攻击面

    建模并利用多智能体网络中子智能体生成时的记忆继承漏洞

    发表
    被测模型
    MiniMax M2.5、Llama-4-Maverick-17B-128E-Instruct-FP8、Qwen3.5-Plus 等 5 个
    摘要形式化子智能体继承,在 OpenClaw 上演示四类编排层漏洞并提出防御。

    作者对多智能体网络里的子智能体继承做形式化分析,并用开源框架上的 PoC 演示编排层如何让单点妥协继续扩散。

    深度解读完整解读
  13. 攻击arXiv 2604.02623

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出 eTAMP,用网页内容跨会话投毒 Web Agent 轨迹记忆并诱导越权操作

    发表
    场景
    web agent
    被测模型
    GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 6 个
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    深度解读完整解读
已经到底了