攻击arXiv 2609.39788·9月30日研究:多智能体系统潜在通信链路可被训练用于提升有害顺从提出只改多智能体潜在通信链路以提高有害遵从的攻击arXiv2609.39788发表9月30日层应用层场景多智能体攻击投毒与后门风险拒答失当摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。深度解读完整解读
可解释性arXiv 2609.06934·9月7日论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练arXiv2609.06934发表9月7日层模型层场景模型与 API防御模型加固攻击模型篡改风险拒答失当组件微调与开源权重摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。深度解读完整解读