全部动态
从来源,看到研究的联系
图中 5 条 · 本页 5 条 · 共 917 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。5 个较少出现的方向归入「其他方向」,点选可查看。
点选节点,展开一条线索
本页材料
完整标题与摘要 · 5 条- 会议论文NeurIPS 2025
效用工程:分析与控制 AI 中涌现的价值体系
用效用函数框架发现 LLM 的偏好随规模呈现结构一致性,并揭示其中存在 AI 重视自身高于人类等问题价值观,提出效用控制方法。
- 会议论文NeurIPS 2025
克服 Crosscoder 的稀疏性伪影以解释 Chat 微调
指出 crosscoder 的 L1 损失会误判概念为微调独有,提出 Latent Scaling 并改用 BatchTopK,找到与虚假信息、拒答相关的 chat 特有 latent。
- 会议论文NeurIPS 2025
LLM 对有害性与拒答的编码是分离的
发现有害性方向与拒答方向相互独立;部分越狱只削弱拒答信号而不改变有害性判断,据此提出对微调攻击鲁棒的 Latent Guard。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门
- 会议论文USENIX Security 2025
弥合视觉语言模型跨模态识别不安全概念的差距
构建 UnsafeConcepts 数据集评测 8 个 VLM,发现存在模态差距,并用基于 PPO 的简化 RL 方法提升图像上的不安全概念识别。