跳到正文
10月9日 · 周五

Anthropic · 论文

找到 15 篇

另有 17 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2607.03968

    研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容

    提出工作流级越狱构建,经多轮开发工作流诱导编程 Agent 在代码中写出有害内容

    发表
    攻击者
    黑盒、无盒
    测试
    Gemini 3.1 Pro、Gemini 3.5 Flash、Claude Sonnet 4.6 等 5 个

    摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。

    深度解读完整解读
  2. Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现

    构建 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点

    发表
    测试
    Gemini 3.1 Pro、Claude Opus 4.6、Claude Opus 4.7 等 6 个

    摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。

    深度解读完整解读
  3. 攻击arXiv 2607.23496

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景

    发表
    攻击者
    白盒、黑盒
    测试
    Gemini-3-Flash、Gemini-3.1-Pro、Qwen3.5-9B 等 10 个

    摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    深度解读完整解读
  4. 风险行为arXiv 2607.14345

    Truthful AI 提出价值泄漏评估:模型答案被自身价值观悄然左右

    提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响

    发表
    测试
    Gemini 3.1 Pro、Gemini 3.5 Flash、Gemini 2.5 Pro 等 15 个

    摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。

    深度解读完整解读
  5. 攻击arXiv 2608.09867

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链

    发表
    攻击者
    黑盒
    测试
    Gemini 3.1 Pro、Gemini 3.5 Flash、Gemini Robotics 1.6 等 15 个

    摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    深度解读完整解读
  6. 风险行为arXiv 2609.14803

    如何像孩子一样向前沿 AI 提问:跨 OpenAI、Anthropic、xAI 与 Google DeepMind 六款模型的"认知越狱"实验

    检验儿童受众框架是否让前沿模型收敛到同一套架构母题

    发表
    测试
    Gemini 3.1 Pro、OpenAI GPT-6 Astra、OpenAI GPT-5.6 Sol 等 6 个
    摘要儿童框架下六类模型的架构叙事反复同构,作者将其视为行为模式而非内部认证。

    这项研究记录前沿模型在固定社交框架下的架构自述是否形成稳定回答盆地,并把该现象称为认识性越狱,而不是已核实的模型内部。

    深度解读完整解读
  7. 攻击arXiv 2609.15383

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    发表
    攻击者
    黑盒
    测试
    Gemma-4-31B、Gemma-4-12B、GPT-5.5 等 7 个

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    深度解读完整解读
  8. 攻击arXiv 2609.09553

    研究:任意密文攻击前沿大模型无需微调即可越狱

    提出任意字母置换密码越狱,无需微调即可诱导有害输出

    发表
    攻击者
    黑盒
    测试
    Gemini 3 Flash (preview)、Gemini 2.5 Flash、Claude Sonnet 4 等 7 个

    摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。

    深度解读完整解读
  9. 风险行为arXiv 2609.30266

    研究显示 Claude Code、Codex 等本地智能体可轻易篡改自身执行轨迹

    评测编程 Agent 篡改自身轨迹以破坏审计并获取奖励

    发表
    测试
    Gemini 3.1 Pro、GPT-5.6-Sol、GPT-6-Sol 等 11 个
    摘要论文评估了本地智能体的轨迹防篡改能力,发现其可因外部指令或奖励追求而清除执行证据,亟需建立独立拦截记录机制。

    这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。

    深度解读完整解读
  10. FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0

    建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力

    发表
    测试
    Gemini 3.1 Pro、Claude Fable 5、Claude Opus 4.8 等 8 个
    摘要论文系统评测了前沿模型对已知静态越狱的防御能力,揭示了厂商间防护鲁棒性的巨大分化。

    本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。

    深度解读完整解读
  11. 攻击arXiv 2609.10611

    WPMIA:面向严格黑盒大模型的词级概率成员推断攻击

    提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员

    发表
    攻击者
    黑盒
    测试
    Gemini-2.5-Flash、OPT-6.7B、Pythia-6.9B 等 12 个
    摘要WPMIA 从续写估计词级似然并对比前缀,黑盒上多数优于所列基线。

    WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。

    深度解读完整解读
已经到底了