攻击arXiv 2606.14517·6月12日研究者披露针对 LLM Agent 护栏的推理扩展型拒绝服务攻击提出针对 LLM Agent 护栏的推理扩展拒绝服务攻击arXiv2606.14517发表6月12日层应用层场景AI Agent攻击者黑盒、白盒攻击拒绝服务技术推理链操控组件护栏与评审+2+2深度解读完整解读
防御arXiv 2608.06422·8月6日CMU 研究:分片判断可避免 LLM 监督失效并抵御对抗利用提出分片监督,将评判标准分配给独立调用以抵御展示攻击arXiv2608.06422发表8月6日层应用层场景LLM 应用攻击者黑盒防御检测与过滤攻击检测规避组件护栏与评审摘要论文揭示决策负载是大模型监督的独立瓶颈,提出分片与辩论机制有效分离注意力与平衡证据,在多项高难度基准上实现稳健评判。本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。深度解读完整解读
攻击arXiv 2607.26115·7月29日OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击arXiv2607.26115发表7月29日层应用层场景AI Agent攻击者黑盒攻击提示注入技术自动化搜索+1+1深度解读完整解读