可解释性arXiv 2609.36138
SAKIKO:对工具调用 LLM 内部干预的机制审计框架
提出 SAKIKO 框架,审计工具调用 LLM 的定向激活干预是否构成修复
- arXiv
- 2609.36138
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 测试
- Phi-3.5-mini、Qwen2.5-7B、Llama-3.1-8B 等 8 个
摘要SAKIKO 用目的地、保持和预注册不确定性裁定内部转向是否算修复。
SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。