评测与基准arXiv:2610.07089 · 10月5日研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹构建统一滥用监视基准,用危害窗口评测跨威胁动作监控AI Agent·测试Gemma 4 26B-A4B、Qwen3.6 27B、Qwen3.5 27B 等 12 个·应用层监控与审计越狱多轮渐进监控器+1+1摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。完整解读
评测与基准arXiv:2609.09798 · 9月9日CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏编程 Agent攻击者黑盒无盒·测试CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个·应用层越狱角色扮演与说服护栏与评审+1+1摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。完整解读