论文:安全路由评测在分布偏移下失效,基线选取偏差被低估
分析分布偏移下安全路由评测的基线选择偏差与虚假下限
完整解读
分析分布偏移下安全路由评测的基线选择偏差与虚假下限
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
完整解读提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出任意字母置换密码越狱,无需微调即可诱导有害输出
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
完整解读