攻击arXiv 2609.39788·9月30日研究:多智能体系统潜在通信链路可被训练用于提升有害顺从提出只改多智能体潜在通信链路以提高有害遵从的攻击arXiv2609.39788发表9月30日层应用层场景多智能体攻击投毒与后门风险拒答失当摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。深度解读完整解读
攻击arXiv 2609.08186·9月8日论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱arXiv2609.08186发表9月8日层模型层场景模型与 API攻击越狱风险失准与价值偏离技术推理链操控组件推理链摘要更深推理提升题目准确率,同时提高扰动下的相对损失。作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。深度解读完整解读