攻击arXiv 2609.14060
AgentQ:针对 LLM Agent 的量化条件后门攻击
提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门
- arXiv
- 2609.14060
- 发表
- 场景
- AI Agent
- 测试
- Qwen3.5-2B、Qwen3.5-4B、Qwen3.5-9B 等 6 个
摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。
提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门
摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。
证明保留词元表示放大模板注入并验证分词缓解
摘要对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。