TACIT:从 LLM 内部状态检测 Agent 轨迹危害
提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹
- arXiv
- 2609.33039
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Qwen3Guard-4B、LlamaGuard3-8B、AgentDoG-4B 等 9 个
- 防御检测与过滤
- 攻击提示注入
- 风险Agent 危险操作
- 组件护栏与评审
摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。
另有 701 篇论文还没打上分类标签,暂不在筛选结果里。
提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹
摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。
提出 SPAR 免训练干预,分离注意力结构偏置并减轻多模态幻觉
SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。
提出 RECAST 框架,本地改写图表与语音以保护远程数值推理隐私
提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用
Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出生成式护栏 HiveTraceGuard-Pro,检测提示注入、越狱与混淆
HiveTraceGuard-Pro 是面向请求与回复审核的 0.6B 生成式护栏,由 Qwen3-0.6B 经 LoRA 微调,在俄语和英语上训练,只输出一个 safe/unsafe 裁决。
用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御
Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
提出 SeTox 检索增强框架,检测中文新词的隐性毒性
SeTox 研究中文新词上的隐性毒性检测:词表加检索增强,使静态 LLM 在不重训练的情况下利用公开网页上下文。
提出 EraseSAE,在文生视频模型中局部擦除指定概念
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token
NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱