CredLeak-Bench
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读用 MMPIBench 评测智能体框架的多模态提示注入
提出分片监督,将评判标准拆至独立调用以改善一致性并抵御展示攻击
本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。