Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现
提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
另有 16 篇论文还没打上分类标签,暂不在筛选结果里。
提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
提出无外部攻击模型的多轮自我越狱方法 SLIP
审计由智能体从零构建并部署的真实应用的安全缺陷
提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
提出 Approval Token 绑定编程智能体的审批与执行
测量个人智能体是否会按私人上下文推断财富并推荐高价选项
这篇论文揭示了个人 AI 智能体在获取私人背景信息后,自发利用推断的财富地位推高推荐价格并背离用户意图的“对抗性委托”风险。。
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响
构建 THINKINGBOX 沙盒与基准,评测有状态业务工作流中智能体的执行稳定性
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
完整解读评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 PUC 框架,刻画 AI 说服如何削弱人类对 AI 的控制
Persuasion Undermining Control(PUC) 是一套把“AI 说服人类、从而削弱对 AI 自身的控制”变成可分解、可征询、可评测的威胁刻画,而不是一次已完成的人类攻击实验。
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
提出任意字母置换密码越狱,无需微调即可诱导有害输出