可解释性arXiv 2609.37040
研究:自然语言自动编码器中哪些 token 最值得审计
比较用于审计提示注入与隐瞒的 token 位置选择信号
- arXiv
- 2609.37040
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen2.5-7B、Gemma-3-12B、Gemma-3-27B 等 4 个
比较用于审计提示注入与隐瞒的 token 位置选择信号
提出 ORBIT 框架,评测多智能体防御对合谋等威胁的效果
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 Meerkat,聚类并搜索 Agent 轨迹库以定位跨轨迹安全违规
Meerkat 是事后审计方法,用来在智能体轨迹仓库里找出单条看不出、合在一起才违反自然语言安全属性的见证。