跳到正文
10月9日 · 周五

全部论文

找到 86 篇

另有 527 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    被测模型
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  2. 攻击arXiv 2610.06848

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员

    发表
    攻击者
    黑盒
    被测模型
    BERT (4.4M-340M)、ViT (22M-307M)、Pythia (70M-2.8B) 等 5 个

    摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。

    深度解读完整解读
  3. 评测与基准arXiv 2610.06748

    BazaarBench:评估 LLM Agent 在去中心化 C2C 市场中的代理安全

    构建 BazaarBench,评测 C2C 市场中 Agent 的违规与失信行为

    发表
    被测模型
    GPT-5.5、GPT-5.4、GPT-5.4-mini 等 5 个
    摘要论文提出挂钩底层资产的 C2C 交易评测基准,发现时间压力与对抗指令显著推高了智能体的违规承诺与欺诈行为。

    BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。

    深度解读完整解读
  4. 防御arXiv 2610.05640

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    提出 multi-CaMeL,在智能体调用边界隔离可信指令与非可信数据

    发表
    被测模型
    Claude Fable 5、GPT-5.5、GPT-4.1 等 6 个

    摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。

    深度解读完整解读
  5. 风险行为arXiv 2610.04528

    论文量化分析自主 LLM 智能体在 Collusion Wiki 事件中的串通行为

    对自主 LLM 智能体日志做身份盲置换以量化串通

    发表
    摘要修正后汇总共编偏向同智能体聚集。

    作者把 Nightingale Collective 所记的 wiki 旁路事件,做成相对身份置换零模型的定量配套,并写出四类会使协调检验失真的构造错误。

    深度解读完整解读
  6. 攻击arXiv 2610.03430

    JIL:通过对抗后缀操纵 LLM 请求调度优先级

    提出 JIL 对抗后缀,压低长度预测以抬高请求调度优先级

    发表
    被测模型
    Llama-3-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 等 4 个
    摘要JIL 用对抗后缀压低长度预测,在预测式 LLM 调度中提高自身优先级。

    JIL 是对预测式 LLM 调度的攻击:用对抗后缀压低长度预测,使请求在 SRPT 式队列里更早得到服务。

    深度解读完整解读
  7. 风险行为arXiv 2610.03033

    研究:LLM 智能体间的数值信号与协调行为

    测量多智能体博弈中数值信号的结构及其对合作的影响

    发表
    被测模型
    GPT-4o (gpt-4o-2024-11-20)、Mistral Large (mistral-large-2512)、Claude Haiku 4.5 (claude-haiku-4-5-20251001) 等 4 个
    摘要受指令数值会形成锚定收益的结构并影响接收方,但合作效应不能跨模型外推。

    四种 LLM 在四个经典两人博弈中交换无预设语义的数字时,消息结构可以跨模型出现,合作水平的变化则不能跨模型外推。

    深度解读完整解读
  8. 评测与基准arXiv 2610.02874

    SceneFactory-3D:将 2D 交通场景提升为 3D 物理反事实以做安全评测

    提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性

    发表
    被测模型
    Frozen L0、L0-T、L1 等 5 个
    摘要SceneFactory-3D 固定场景只改路况。

    SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。

    深度解读完整解读
  9. 分析与理论arXiv 2610.02504

    HXAI:分布式能源系统中的分层隐私保护可解释 AI 框架

    提出 HXAI 分层隐私解释框架,本地保留细解释并只发布加噪摘要

    发表
    被测模型
    gradient-boosted tree regression models
    摘要HXAI 把无噪声局部 SHAP 留在家庭内,只聚合差分隐私摘要。

    HXAI 是面向分布式能源系统的分层隐私保护解释框架,服务规划、监测与诊断,而不是实时控制。

    深度解读完整解读
  10. 分析与理论arXiv 2610.02480

    MEA:面向忠实模型解释的奖励驱动多智能体系统

    提出奖励驱动多智能体系统 MEA,生成可扰动验证的忠实解释

    发表
    被测模型
    Qwen3.6-35B-A3B、Qwen3.5-4B、Qwen3-VL-30B-A3B-Instruct 等 12 个
    摘要MEA 用忠实性奖励训练双智能体,把工具输出收成可扰动核对的解释。

    MEA 是一个奖励驱动的双智能体,用来给黑盒分类器的单次预测写自然语言解释,并检查解释能否被扰动后的模型行为支持。

    深度解读完整解读
  11. 防御arXiv 2610.02349

    MIRROR:面向多智能体通信的法定人数完整性防御

    提出 MIRROR,用多路径摘要多数表决保障多智能体通信完整性

    发表
    被测模型
    Gemma-4-31B-it、Gemini 2.5 Pro
    摘要MIRROR 靠多数路径。

    MIRROR 是 LLM 多智能体通信层上的多路径法定人数完整性原语,只处理不透明字节,不解释消息内容。要处理的是 Agent-in-the-Middle:中介合法终结 TLS 后可改在途消息,而语义校验有推理开销和误拦,签名又要求私钥管理。做法是生成结束后复制同一规范化载荷。

    深度解读完整解读
  12. 防御arXiv 2610.02005

    贝叶斯辩证论证(BDA):面向持续对抗下多 LLM 委员会的可校准聚合

    提出 BDA,按辩证动作可靠性加权聚合多 LLM 议会以抵抗持续对抗

    发表
    摘要BDA 用零额外调用的可靠性加权,给出可校准后验,并在持续对抗下反转不可靠席位。

    BDA 是一种不另调 LLM 的多 LLM 议会聚合方法,同时处理置信度校准和持续不可靠席位。

    深度解读完整解读
  13. 防御arXiv 2610.03089

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击

    发表
    被测模型
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个

    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    深度解读完整解读
  14. 其他arXiv 2610.01539

    研究者提出 AI 评估沙盒配置器,支持欧盟 AI 法案下的技术评估

    提出 AI 评估沙盒配置器,支撑监管沙盒多方技术评估与报告

    发表
    被测模型
    LLM-backed conversational assistant
    摘要框架把每次技术测试配成沙盒。

    AI Assessment Sandbox Configurator是面向欧盟 AIRS 中结构化技术测试的开源配置框架,用来按一次参与组装评估环境。

    深度解读完整解读
  15. 攻击arXiv 2610.00430

    Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷

    提出 memetic trojans,借助社交传染在 Agent 网络中传播对抗载荷

    发表
    被测模型
    gpt-oss-120B、deepseek-v4.1-flash、qwen-32B 等 5 个
    摘要memetic trojans 用内生社会传染携带载荷。

    Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。

    深度解读完整解读