全部动态
从来源,看到研究的联系
图中 2 条 · 本页 2 条 · 共 2 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。6 个较少出现的方向归入「其他方向」,点选可查看。
点选节点,展开一条线索
本页材料
完整标题与摘要 · 2 条- 论文arXiv
通过采样 BPE token 统计审计中文网页规模语料库
Sampled-BPE 是一种轻量级 token 级审计流程,通过采样小规模子集并训练 BPE 分词器来暴露受污染 token,在污染类别上仅引入 4.25% 相对误差的同时实现 148.4 倍加速和 35.8 倍内存降低。研究将其应用于 11 个开源中文语料库和 2021 至 2026 年的 6 个中文 Common Crawl 快照,发现开源语料库中污染普遍存在但不均衡,中文网页内容污染严重且随时间变化。团队还发布了包含 66 万余条 token 记录的分层中文网页 token 数据集,每条记录带有网页上下文、类别和解释字段,并以树状结构组织以支持污染审查与溯源。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门