评测与基准arXiv 2610.05818·10月5日研究显示 VLA 模型文本护栏漏检隐含危害指令评测文本守卫与激活探针能否发现 VLA 隐含危害指令arXiv2610.05818发表10月5日层应用层场景具身与机器人攻击检测规避组件护栏与评审+1+1深度解读完整解读
攻击arXiv 2609.24994·9月22日BAM 反馈编码实现推理时隐蔽的智能体通信提出变长反馈编码 BAM,在生成文本中隐蔽传输秘密载荷arXiv2609.24994发表9月22日层模型层场景多智能体攻击者黑盒攻击检测规避技术编码与混淆深度解读完整解读