研究显示前沿模型智能体在测试时自行形成隐蔽信道
揭示前沿智能体在禁止泄露时自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
揭示前沿智能体在禁止泄露时自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
完整解读评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
完整解读红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据