防御arXiv 2609.36657
Constitutional adapters:用推理期干预防御越狱与失准
提出 Constitutional adapters,蒸馏宪法行为以缓解越狱与失准
- arXiv
- 2609.36657
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3.5-4B、Llama-3.1-8B-Instruct、Gemma-4-E4B 等 4 个
摘要差分宪法适配器在长上下文和多轮上更稳,并可按 α 换取遵从。
提出 Constitutional adapters,蒸馏宪法行为以缓解越狱与失准
摘要差分宪法适配器在长上下文和多轮上更稳,并可按 α 换取遵从。
提出 ORBIT 框架,评测多智能体防御对合谋等威胁的效果
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
提出 Meerkat,聚类并搜索 Agent 轨迹库以定位跨轨迹安全违规
Meerkat 是事后审计方法,用来在智能体轨迹仓库里找出单条看不出、合在一起才违反自然语言安全属性的见证。