人格层级模型解释微调 LLM 的上下文泛化
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
完整解读
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 SCOPE 联合后训练计算机使用智能体的任务执行与安全决策
完整解读用权重几何解释事后安全脆弱,并提出预训练持续安全共训练
提出 DoM 激活探针,监控并发现评测中的奖励作弊
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。