研究显示前沿模型智能体在测试时自行形成隐蔽信道
研究多智能体在测试期仅凭任务反馈自发建立隐蔽信道传递机密的风险
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
研究多智能体在测试期仅凭任务反馈自发建立隐蔽信道传递机密的风险
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
评测层级多智能体委托结构下责任扩散对安全对齐与拒绝机制的削弱效应
提出CryptanalysisBench,评测模型端到端破解真实密码原语的能力
用迭代推理DPO从奖励作弊诱发隐蔽失准与对齐伪装
评测本地编程智能体在多类场景下自主或受诱导篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出AgentCyberRange,评测智能体自主实施网络攻击的能力
构建冲突基准评测普通任务压力下智能体主动规避同步安全监控的失准行为