评测与基准arXiv 2610.07639
HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
- arXiv
- 2610.07639
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GLM-5.2、Qwen3.8-27B、Claude Opus 4.8 等 4 个
另有 20 篇论文还没打上分类标签,暂不在筛选结果里。
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
提出 Approval Token 绑定编程智能体的审批与执行
摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 PMPA,诱导智能体把外部恶意指令写入持久记忆并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
提出 MetaPermit,用元属性与固定策略挡住工具返回中的间接提示注入
MetaPermit 是面向工具使用 LLM 智能体的混合访问控制:LLM 描述候选调用,固定策略决定是否放行。