跳到正文
原文
arXiv· arXiv:2609.36879· Haoran Ou·· 3 天前

SKILLLITE:用小模型做证据引导的恶意 Agent Skill 审计

SKILLLITE: Evidence-Guided Malicious Skill Auditing with Compact LLMs

AI 导读

SKILLLITE 是一个证据引导的智能体框架,用紧凑、可本地部署的 LLM 检测 Agent Skill 中的恶意行为。研究指出小模型难以识别复杂 Skill 包中隐含的恶意行为,SKILLLITE 先提取安全相关行为并推断 Skill 的预期功能,再据此评估恶意性。

阅读原文arxiv.org