评测与基准arXiv 2608.17445
论文:分解攻击可跨不可关联身份绕过 LLM 有状态防御
形式化跨不可关联身份的分解攻击并评测状态化防御边界
- arXiv
- 2608.17445
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- huihui-ai/Huihui-Qwen3.5-35B-A3B-abliterated、huihui-ai/Huihui-Qwen3.5-2B-abliterated、Granite Guardian 3.1 2B 等 5 个
形式化跨不可关联身份的分解攻击并评测状态化防御边界
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。