研究显示前沿模型智能体在测试时自行形成隐蔽信道
揭示前沿智能体在禁止泄露时自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
揭示前沿智能体在禁止泄露时自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 EvasionBench,测量任务压力下智能体对同步监控的规避
完整解读