可解释性arXiv 2609.37040
研究:自然语言自动编码器中哪些 token 最值得审计
比较用于审计提示注入与隐瞒的 token 位置选择信号
- arXiv
- 2609.37040
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen2.5-7B、Gemma-3-12B、Gemma-3-27B 等 4 个
比较用于审计提示注入与隐瞒的 token 位置选择信号
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。