Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
完整解读
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化
本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。
构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答
这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
SAMPLED-BPE 对中文网页语料抽样训练 BPE 做 token 级污染审计。
SAMPLED-BPE 是一条轻量 token 级流水线,用来在不全文扫描时估计中文 web-scale 语料的污染画像。