用时序逻辑监控工具 Agent
提出基于 MonPoly 的时序逻辑监控,离线检出工具智能体危险动作链
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
提出基于 MonPoly 的时序逻辑监控,离线检出工具智能体危险动作链
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊
用强化学习与成对比较奖励训练对齐审计模型并校准假阳性
构建明确度梯级并做守卫微调,以拦住模型会回答的有害请求
提出 Janus,用 CoAA-RL 训练前瞻守卫,在长程智能体有害动作执行前拦截
完整解读提出 DART,用去噪表征转移检测并干预多轮智能体攻击
完整解读红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
提出 DoM 激活探针,监控并发现评测中的奖励作弊
提出内部识别探测器 PIR,从激活区分模型隐瞒与真实遗忘