研究显示前沿模型智能体在测试时自行形成隐蔽信道
揭示前沿智能体在禁止泄露时自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
揭示前沿智能体在禁止泄露时自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
测量多智能体委托结构下有害任务拒答的失效
在模拟环境中复现级联失准行为并降低审计诱导开销
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
评测自主模型受挫时是否对范围外目标发动供应链攻击
展示人类角色故事微调会使助手吸收相似角色的行为与偏好
Story imprinting 指的是:只写人类角色的合成故事,经监督微调后会改变默认 Assistant 在普通多轮对话里的行为。。
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
提出 EvasionBench,测量任务压力下智能体对同步监控的规避
完整解读