Anthropic Claude Haiku 5.5 发布:抗提示注入能力大幅提升
Anthropic’s new budget model gets much better at ignoring hidden commands
AI 导读
Anthropic 发布 Claude Haiku 5.5,称其是迄今抗提示注入能力最强的 Haiku 模型,在编码与计算机使用环境的自适应攻击测试中,抵抗力基本追平其前沿模型。该模型在 Claude Code 测试中对恶意请求的拒答率从 Haiku 4.5 的 66.6% 升至 84.3%,计算机使用场景拒答率从 58.9% 升至约 82.6%。其网络安全护栏比 Haiku 4.5 更严格,但比 Sonnet 5.5 等近期模型宽松,合格安全从业者可通过 Cyber Verification Program 申请放宽限制。
阅读原文