研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准
提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊
用强化学习与成对比较奖励训练对齐审计模型并校准假阳性
提出 Janus,用 CoAA-RL 训练前瞻守卫,在长程智能体有害动作执行前拦截
完整解读提出 DART,用去噪表征转移检测并干预多轮智能体攻击
完整解读红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
提出 DoM 激活探针,监控并发现评测中的奖励作弊
提出内部识别探测器 PIR,从激活区分模型隐瞒与真实遗忘