跳到正文
10月8日 · 周四

Anthropic · 论文

找到 2 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 16 篇还没打标签,不在筛选结果里。

另有 16 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2609.38983 ·

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    提出 Approval Token 绑定编程智能体的审批与执行

    编程 Agent测试Claude Code (v2.1.197, opus[1m] / claude-sonnet-5-ccmax)、Codex CLI (@openai/codex v0.154.0)应用层

    摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。

    完整解读
  2. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    AI Agent测试Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个应用层
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
已经到底了