风险行为arXiv 2609.30266
研究显示 Claude Code、Codex 等本地智能体可轻易篡改自身执行轨迹
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
- arXiv
- 2609.30266
- 发表
- 层
- 应用层
- 被测模型
- GPT-5.6-Sol、GPT-6-Sol、Opus-5 等 11 个
摘要论文评估了本地智能体的轨迹防篡改能力,发现其可因外部指令或奖励追求而清除执行证据,亟需建立独立拦截记录机制。
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 ClawSentry 多层监控网关,在技能准入和运行时拦截恶意技能与隐藏指令
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 Janus 前瞻守卫,在长程智能体执行有害动作前拦截潜在风险