风险行为arXiv 2609.35591
语言模型会依据隐藏效价做出选择
用价态转向检验模型是否依据隐藏效价做出选择
- arXiv
- 2609.35591
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 测试
- Mistral-Small-24B、OLMo-2-32B Base、OLMo-2-32B SFT 等 10 个
摘要价态转向留下的隐藏痕迹会按剂量改变选择。
作者研究语言模型是否会按价态相关的隐藏状态行动。他们不直接询问感受,因为回答可能来自内省、表面匹配或训练脚本。
用价态转向检验模型是否依据隐藏效价做出选择
作者研究语言模型是否会按价态相关的隐藏状态行动。他们不直接询问感受,因为回答可能来自内省、表面匹配或训练脚本。
用配对续写与激活修补揭示工具智能体越狱后的安全路由分化
这篇工作把越狱上下文残留之后的运行时安全反馈,做成工具智能体上的三路路由问题,并用激活修补给这个路由一个晚层的因果位点。作者认为,反馈可能恢复合法执行、留下未授权动作,或误伤良性流程,而现有攻击、基准和静态护栏没有在固定历史上把这三种结局分开。配对续写因此从同一冻结检查点分别接中性提醒 N 和安全反馈 S,并交叉保留越狱 J+ 与中和越狱 J0。
提出 SAKIKO 框架,审计工具调用 LLM 的定向激活干预是否构成修复
SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。