ColluSkill 用跨技能组合绕过 Agent 技能扫描器
提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器
- arXiv
- 2608.09732
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GPT-5.5、DeepSeek-V4-Pro、GLM-5.2
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
另有 643 篇论文还没打上分类标签,暂不在筛选结果里。
提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
提出 SpecGuard,在编码 Agent 执行前证明任务与测试冲突
摘要提出预执行冲突检测与证明框架,在多个基准和真实仓库中成功证明任务与测试不可同时满足。
提出 AgentSpy,在系统调用层观测 Agent 并检测技能注入
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 HACKTRACE,用生成期激活检测代码智能体的奖励作弊
摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。
提出 Approval Token 绑定编程智能体的审批与执行
摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 SkillSecurer,检测定位并修补智能体技能中的提示注入
提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
提出 Auto Mode ++,加固编码 Agent 的阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
提出 DoM 探针,监控并发现评测中的奖励作弊
摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。
提出 HazardAuditor 与 GuardPO,训练计算机使用智能体的运行时守卫
提出 RSI-Master 以约束自主后训练动作并抑制奖励作弊
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。