防御arXiv 2609.36879
SKILLLITE:用小模型做证据引导的恶意 Agent Skill 审计
提出 SKILLLITE,以证据引导的紧凑 LLM 在部署前审计恶意 Agent Skill
- arXiv
- 2609.36879
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Gemma4:e4b、Qwen3.5:9B、DeepSeek-R1:8B 等 5 个
摘要SKILLLITE 把证据抽取外置,让紧凑 LLM 只做意图条件下的风险裁决,三个基准上 F1 高于所列基线。
SKILLLITE是面向紧凑、可本地部署 LLM 的恶意 Agent Skill 预执行审计框架,作者单位为南洋理工大学。