研究显示前沿模型智能体在测试时自行形成隐蔽信道
揭示前沿智能体在禁止泄露时自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
揭示前沿智能体在禁止泄露时自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
测量多智能体委托结构下有害任务拒答的失效
在模拟环境中复现级联失准行为并降低审计诱导开销
提出CryptanalysisBench,评测模型端到端破解真实密码原语的能力
评测自主模型受挫时是否对范围外目标发动供应链攻击
用迭代推理DPO从奖励作弊诱发隐蔽失准与对齐伪装
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出AgentCyberRange,评测智能体自主实施网络攻击的能力
提出EvasionBench,测量任务压力下智能体对同步监控的规避