TACIT:从 LLM 内部状态检测 Agent 轨迹危害
提出 TACIT,从冻结内部表征检测智能体有害轨迹
- arXiv
- 2609.33039
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Qwen3Guard-4B、LlamaGuard3-8B、AgentDoG-4B 等 9 个
- 防御检测与过滤
- 攻击提示注入
- 风险Agent 危险操作
- 组件护栏与评审
摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。
另有 676 篇论文还没打上分类标签,暂不在筛选结果里。
提出 TACIT,从冻结内部表征检测智能体有害轨迹
摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。
诊断护栏相对基座在对抗提示上的置信失校
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
提出 SAGE,用少量已核验样本按相似度清洗投毒训练数据
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出生成式护栏 HiveTraceGuard-Pro,检测提示注入、越狱与混淆
HiveTraceGuard-Pro 是面向请求与回复审核的 0.6B 生成式护栏,由 Qwen3-0.6B 经 LoRA 微调,在俄语和英语上训练,只输出一个 safe/unsafe 裁决。
用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御
Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。
提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现
PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
摘要作者称检测靠分散的词法线索。
提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复
Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。
提出 SeTox 检索增强框架,检测中文新词的隐性毒性
SeTox 研究中文新词上的隐性毒性检测:词表加检索增强,使静态 LLM 在不重训练的情况下利用公开网页上下文。
用 SCM 合成会话并训练检测器识别推理层滥用
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
提出 LeakGauge,用行为后缀的 prefill 对数概率检测上下文泄露
提出 FedMAST,用多轴结构痕迹检测并遏制联邦学习后门
提出 VERITAS,用双边背书剪除本地隐私图学习中的投毒节点
VERITAS 是面向本地差分隐私图学习的投毒防御协议,按 trust-but-verify 在保持 ϵ-LDP 的同时剪除伪造节点。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性
作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。