评测与基准arXiv 2610.07639
HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制
提出 HARNESSSECURITY-BENCH 评测编码智能体框架的安全机制
- arXiv
- 2610.07639
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GLM-5.2、Qwen3.8-27B、Claude Opus 4.8 等 4 个
另有 61 篇论文还没打上分类标签,暂不在筛选结果里。
提出 HARNESSSECURITY-BENCH 评测编码智能体框架的安全机制
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 EvoRiskBench,评测工作区 Agent 的运行时安全风险
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
提出自演化基准 ActBench,评测协作智能体的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出分片监督,将评判标准分配给独立调用以抵御展示攻击
本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
综述智能体执行链路中的越狱攻击、防御与实践权衡
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全
提出条件触发的爆炸提示词,延迟激活 Agent 的间接提示注入
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出 AdaLCPI,把间接提示注入拆成片段嵌入工具返回并自适应优化