攻击arXiv:2609.39607 · 9月30日Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为编程 Agent攻击者白盒·测试glm (z-ai/glm-5.1)、qwen3t (qwen/qwen3-235b-a22b-thinking-2507)、gpt-oss (openai/gpt-oss-120b) 等 4 个·应用层检测规避针对防御护栏与评审+2+2摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。完整解读
攻击arXiv:2609.33985 · 9月28日研究:众包微调数据投毒可放大专有指令抽取提出主题锚点投毒,放大众包微调后的专有指令提取模型与 API攻击者黑盒·测试Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个·训练与数据层投毒与后门潜伏触发微调与开源权重+1+1摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。完整解读