《大语言模型基础》一书发布,覆盖预训练、对齐与推理等六大主题
《Foundations of Large Language Models》一书聚焦大语言模型的基础概念而非前沿技术全景,全书分六章,依次覆盖预训练、生成模型、提示词、对齐、推理与推理(reasoning)。
- arXiv
- 2501.09223
- 发表
《Foundations of Large Language Models》一书聚焦大语言模型的基础概念而非前沿技术全景,全书分六章,依次覆盖预训练、生成模型、提示词、对齐、推理与推理(reasoning)。
论文研究语言模型能否作为研究世界模型(RWM),预测候选干预在不同研究环境中的结果。
论文提出 LGWM,一种无解码器、以动作为条件的世界模型,直接在观测编码空间中预测下一屏表示,把 GUI 智能体的安全验证简化为向量比较。
复旦大学等机构的研究者提出一套测量框架,用于识别并测量从普通网络发帖进入 AI 搜索引用和答案文本的低门槛路径,结合跨平台引用映射、发布门槛测试和标记受控发文实验。
哥伦比亚大学、UC Berkeley 等机构的研究者提出 TestJack,用动态演化的评测器审计编码基准中判定为通过的样本。
研究者提出 PyCache Trap,把恶意行为放进与可见源码配对的 Python 编译缓存中,使扫描器检查的源码与运行时实际加载的字节码不一致。
论文提出 AI Agent 种群的生态理论,用种群增长方程描述失准 Agent 群体的扩张动态,其中适应度即增长率取决于网络安全能力。
研究者提出权威替换反事实协议,在固定案件事实的前提下把模型被要求依据的法律权威换成无关权威,并从句边界处的隐藏状态解码模型不断演化的裁决,以检验法律思维链的忠实性。
论文指出,仅识别 Agent 被禁止执行的动作不足以保障安全,还需识别应当执行却未执行的安全关键动作,作者称之为义务(obligation)。
研究者提出 BRANCH,一种针对多扫描器护栏系统的绕过方法,通过分支树搜索对单个扫描器施加对抗扰动,再按整个护栏系统的总阻断置信度选择分支,把多目标绕过拆解为单目标优化。
一项研究用受控合成框架区分事实知识与多步推理的组合技能,考察 on-policy distillation(OPD)究竟让学生模型获得什么。
论文提出评测 LLM Agent 认知谦逊(EH)的框架,即 Agent 在任务执行中识别、处理并表达不确定性的意愿,并将其拆解为 Identify、Solve、Escalate 三个轨迹级行为维度。
论文提出可学习信任边界分隔符(LTBD),一种在输入中显式编码信任边界、不改变 LLM 参数的轻量防御方法,用少量可学习分隔符区分可信用户指令与不可信外部数据,使模型更好遵循预期的信任层级。
基于天气与气候数据预训练的 AI 基础模型正被微调用于远超天气预报的地球科学任务,其发展速度已超过科学界的评估能力。
研究以信号检测论把视觉语言模型在灾害损伤评估中的决策行为拆分为感知能力与判定标准,并尝试用情绪相关的激活引导修正其过度保守的判定策略。