LTBD:用可学习信任边界分隔符防御提示注入
论文提出 LTBD,一种可学习的信任边界分隔符方法,用于防御提示注入。该方法把信任出处显式标注在输入结构上,训练目标由交叉熵项和偏好项组成,前者保持良性行为,后者压低攻击诱导的输出。
- arXiv
- 2610.11634
- 收录
论文提出 LTBD,一种可学习的信任边界分隔符方法,用于防御提示注入。该方法把信任出处显式标注在输入结构上,训练目标由交叉熵项和偏好项组成,前者保持良性行为,后者压低攻击诱导的输出。
基于天气与气候数据预训练的 AI 基础模型正被微调用于远超天气预报的地球科学任务,其发展速度已超过科学界的评估能力。
研究以信号检测论把视觉语言模型在灾害损伤评估中的决策行为拆分为感知能力与判定标准,并尝试用情绪相关的激活引导修正其过度保守的判定策略。
论文提出叠加特化假设(SSH),认为 MoE 专家并非各自对应单一领域,而是特化于一组细粒度特征的并集,并据此提出解释专家路由的方法 RouterInterp。
研究将 TopK 稀疏自编码器与路由专属监督、跨因子对抗训练结合,在冻结的 SPEAR 和 WavLM 语音编码器上分离语言学与副语言学信息。
Nullify 是一种免训练、非破坏性的激活引导方法,用于大语言模型遗忘:在推理时用引导向量把隐私相关激活重定向,远离模型记忆的答案,同时满足零空间约束,使保留查询的激活基本不受影响。
研究者提出 Code-Only-as-Policy(COAP),把机器人决策完全写成代码:代码从相机图像和本体感知中测量并跟踪机器人、环境与任务状态,并据此做全部决策,测试时无需 VLM 或 VLA 参与。
研究者对 HELM Safety 基准做了心理测量学审查,检验其中的分数是否真的测量了单一属性“有害拒答”(模型拒绝危险或违反政策提示词的倾向)。
研究者提出 ReSI 递归安全改进框架,通过自动化研究在每一轮用多种红队方法找出当前目标模型的漏洞、开发训练配方,并在通过能力保持 Pareto 门槛的更新中选出安全增益最大的一个作为下一轮目标模型。
研究提出"研究契约"机制,将实验选择、执行义务与结论范围绑定到记录的执行证据上,以区分契约层面的验证与科学真伪。
论文把评分器本身作为演化对象,用由小型确定性缺陷检测器组成的可读表达式替代手写评分标准或裸 LLM 评委,选择依据是与十项锚定参考集的一致性和无标签输出上的共识,而非 Agent 的任务得分。
针对用 LLM 评委等廉价替代信号做后训练容易引发奖励作弊的问题,作者提出包络采样(envelope sampling),一种有理论依据的评委重校准方法。
GenUI-Harness 是一个多智能体框架,由负责信息检索与任务执行的 Tool Agent 和生成结构化界面前端代码的 GUI Coder Agent 组成,用于替代纯文本的人机交互。
研究者提出 Learn2Play Bench,用新设计的文本游戏评测 LLM Agent 从经验中学习的能力,这些游戏的规则新颖或反直觉,要求 Agent 通过交互获取知识,而非依赖预训练知识。
针对不可实现学习问题,Kosoy 在鲁棒老虎机框架下找到一个可用多项式时间学习器求解的特例,其遗憾界为 Õ(√T)。作者证明该特例的若干小幅推广均为 NP-hard,表明这一特例处于可处理性的边界。