跳到正文
原文
OpenAI·本站收录 · 原文发表 精选关注度43

OpenAI 改进前沿 LLM 的指令层级

Improving instruction hierarchy in frontier LLMs

AI 导读

OpenAI 的 IH-Challenge 通过训练让模型优先执行可信指令,以改进前沿 LLM 的指令层级、安全可引导性以及对提示注入攻击的抵抗能力。

推荐理由

OpenAI 介绍了 IH-Challenge 这一训练方法,让模型优先执行可信指令,为提示注入防护提供了一条可迁移的训练思路。

阅读原文openai.com