可解释性arXiv 2610.12361
研究:法律推理模型引用法条不等于依据法条
用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条
- arXiv
- 2610.12361
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3-8B、Qwen3-14B、Llama-3.1-8B 等 7 个
摘要作者通过依据置换反事实与内部承诺追踪发现法律 CoT 裁决对依据依赖度有限,且易受提示注入操纵。
本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。
用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条
本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
用分类后缀提升激活探针对分布外恶意输入的检测
用户轮后的分类后缀,被作者用作激活探针的分布外检测干预:排序看格式,低 FPR 精度看是否点名恶意/良性。
用因果激活修补定位模型服从提示注入的决策层
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。
比较用于审计提示注入与隐瞒的 token 位置选择信号
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
提出生成式护栏 HiveTraceGuard-Pro,检测提示注入、越狱与混淆
HiveTraceGuard-Pro 是面向请求与回复审核的 0.6B 生成式护栏,由 Qwen3-0.6B 经 LoRA 微调,在俄语和英语上训练,只输出一个 safe/unsafe 裁决。
提出 Ghostwriter 攻击,用伪权威证据条件注入操纵模型观点
Ghostwriter 是一种针对上下文窗口的观点引导攻击:把误导陈述改写成伪权威文本,再在相关查询中让目标模型把该观点写进回答。