Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现
提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
另有 17 篇论文还没打上分类标签,暂不在筛选结果里。
提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
提出 IEC 协议与 IntAct,定位并修复工具调用执行路径的静默篡改
审计由智能体从零构建并部署的真实应用的安全缺陷
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
提出 Approval Token 绑定编程智能体的审批与执行
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
完整解读评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出 PMPA,诱导智能体把外部恶意指令写入持久记忆并跨会话泄露隐私