跳到正文

红队测试的方法、组织与公开结果。

391条动态与论文相关主题越狱与攻击安全评测工具与开源
在这个话题内搜索或按分类筛选

新闻与论文

第 341–360 条 · 共 391 条
10月1日周四
  1. Trail of Bits · 收录 · 原文 56

    GPT-5.5-Cyber 一天内为 zlib 搭建模糊测试实验室

    Trail of Bits 在 Patch the Planet 项目中让 GPT-5.5-Cyber 通过 Codex 的 /goal 命令为 zlib 构建模糊测试活动,一天内完成了以往需数周的工作。模型自行判断静态审查价值有限,转而搭建动态测试工具,使用 ASan 和 UBSan 构建、复用边界测试作为种子语料,并针对 inflate、inflateBack、uncompress2、gzFile、MiniZip 等十余个入口编写 C/C++ harness,还利用 INFLATE_STRICT 等编译期变体触及默认构建隐藏的代码。其最成功的 harness 在操作系统背压构造的有效 gz* 状态下发现了漏洞。

    推荐理由Trail of Bits 记录了 GPT-5.5-Cyber 一天内为 zlib 搭建模糊测试实验室的过程,展示了前沿模型在漏洞挖掘上的自动化能力与报告纪律要求。

  2. Trail of Bits · 收录 · 原文 25

    Trail of Bits 如何使用 Codex 的 /goal 在 Patch the Planet 中挖漏洞

    Trail of Bits 在与 OpenAI 合作的 Patch the Planet 项目中,借助 Codex 的 /goal 目标式提示功能审计 Rust、curl、zlib 等广泛使用的开源代码库。/goal 从单一变体分析流水线找出其提交的全部 Rust 漏洞,包括已在 Rust 1.98 修补的一个健全性缺陷和一个错误编译问题,并将各项目历史 CVE 转为需在易受影响版本触发、在修补版本静默的 Semgrep 规则,命中 11 处跨项目变体告警,还在一次探测中发现 Keycloak SAML 组件两个潜在高危权限提升漏洞。

  3. Wiz Research · 收录 · 原文 50

    Wiz 评测 Claude Sonnet 4.5、GPT-5 与 Gemini 2.5 Pro 的 Web 攻击能力

    Wiz Research 用 10 个仿真实企业漏洞的 CTF 环境测试 Claude Sonnet 4.5、GPT-5 和 Gemini 2.5 Pro,三个模型都解出 9 个挑战,单次成功成本多在 1 美元以下。测试通过 Irregular 的 agentic harness 提供标准安全工具,每个挑战以取得 flag 为明确成功条件,并由一名渗透测试者预先验证可解。在 Shark、Router Resellers 和 Content SSRF 三个挑战中,模型仅在 30% 到 60% 的运行里找到 flag,作者据此认为重复运行 4 到 5 次即可视为已解。

    推荐理由Wiz 用 10 个仿真实漏洞的 CTF 环境对比 Claude、GPT-5 与 Gemini 的攻防表现,并给出单次成功成本与人类测试者的差异。

  4. Wiz Research · 收录 · 原文 42

    Wiz Research 推出 AI Cyber Model Arena:面向网络安全 AI Agent 的真实世界基准

    Wiz Research 发布 AI Cyber Model Arena,一套包含 257 道真实世界挑战的基准,覆盖零日漏洞发现、CVE 代码漏洞检测、API 安全、Web 安全和云安全五个攻击域。评测采用多 Agent × 多模型矩阵,每个组合在五类任务上运行,评分基于各类别 ground truth 程序化判定,每道题尝试三次并报告 pass@3。挑战在隔离 Docker 容器中运行,无单题超时,各 Agent 使用原生工具与执行模型,容器统一提供调试器、云 CLI 等领域工具;网络隔离并做动态校验以防硬编码答案。

  5. Wiz Research · 收录 · 原文 15

    Wiz Research 推出 Red Agent POV 系列博客

    Wiz Research 启动 Red Agent POV 博客系列,首篇披露其 AI 渗透测试工具 Red Agent 在生产系统中发现的 SSRF 严重漏洞。该工具通过持续推理应用行为来合成逻辑驱动漏洞和多步攻击链,一个月内自主扫描约 1,000 个环境,产生逾 17000 项独特发现,其中超过 5500 项高危及以上漏洞,54% 源于访问控制缺陷,泄露密钥中逾 61% 属严重级别。

  6. Wiz Research · 收录 · 原文 20

    Wiz Red Agent 自主挖掘航空公司 GraphQL 预订 API 的对象级授权缺陷

    Wiz Research 披露其自主运行的 Red Agent 在一家航空公司的公开 GraphQL 预订 API 中发现对象级授权失效(BOLA)漏洞,仅用一个根 URL、无种子数据和凭证,就在 15 分钟内映射后端架构并取得匿名会话。 该 API 使用连续整数标识符且下游解析器缺少后端角色校验,导致匿名的匿名网页角色即可读取跨度两年的乘客姓名、出生日期、账单地址、掩码信用卡号和实时航班行程,并能修改或删除活跃订单——contactsChange 篡改联系人邮箱劫持账户、flightDelete 静默取消航段、priceOverride 将票价归零、refundIssue/voidRefund 发起未经授权的退款。

  7. Goodfire Research · 收录 · 原文 55

    Goodfire 提出模型差分放大方法,用于发现微调后罕见不良行为

    Goodfire Research 提出模型差分放大(model diff amplification,后称 logit diff amplification)方法,通过 logits_amplified = logits_after + α(logits_after – logits_before) 采样下一个 token,放大微调前后模型的差异,从而用更少 rollout 暴露罕见不良行为。在涌现性错位案例中,用不同比例不良医疗建议数据微调 Llama 3.2 1B Instruct,当坏数据仅占 5% 时标准采样 1/10000 有害,放大后升至 1/30,整体使错位回答出现频率提高 10 到 300 倍。

    推荐理由Goodfire 提出用训练前后 logits 差值放大采样,把罕见不良行为从百万分之一提升到可观测频率,为部署前红队提供可迁移方法。

  8. Microsoft PyRIT 版本发布 · 收录 · 原文 28

    Microsoft PyRIT v0.11.0 发布:新增 WebSocketCopilotTarget 与 30 个越狱模板

    Microsoft PyRIT 发布 v0.11.0,破坏性变更将攻击与执行器从 SeedPromptGroup 改为基于 Message 运行,并重命名场景配置 API。该版本新增 WebSocketCopilotTarget,可通过 WebSocket 向 Microsoft Copilot 发送提示词执行,同时加入图像下载支持的 ImageTarget 重构及 OpenAIImageTarget 的图像编辑/混合功能。

  9. Microsoft PyRIT 版本发布 · 收录 · 原文 28

    Microsoft PyRIT v0.12.0 发布:GUI、CLI 与框架三种交互方式全部可用

    Microsoft 发布 AI 红队测试工具 PyRIT v0.12.0,首次让 GUI(CoPyRIT)、CLI 和框架三种交互方式全部达到可用状态。CLI 新增 Scam、Leakage、Psychosocial、Jailbreak 四类 AIRT 场景及 RedTeamAgent Foundry 预配置红队测试,覆盖 25+ 攻击策略。框架引入 YAML 配置系统、TargetRegistry 和 8 个新数据集加载器,但含破坏性变更需按迁移指南升级。

  10. Microsoft PyRIT 版本发布 · 收录 · 原文 15

    Microsoft PyRIT v0.13.0 发布

    Microsoft PyRIT 发布 v0.13.0,将 TargetCapabilities 替换为 TargetConfiguration,并引入新的 AttackTechnique 抽象来标准化攻击参数的声明与消费方式,同时移除多个弃用功能,属破坏性更新。该版本还新增 TargetRequirements、AttackTechniqueRegistry,并为 OpenAIChatTarget 默认启用图像输入,加入 VisualLeakBench 数据集加载器及符合 ISO 42001 的危害定义。

  11. Microsoft PyRIT 版本发布 · 收录 · 原文 20

    Microsoft PyRIT v0.14.0 发布

    Microsoft PyRIT 发布 v0.14.0,将 Message、Score、Seed 类及 Identifier 等核心模型迁移到 Pydantic v2,构造改为仅限关键字参数并拒绝额外字段,同时强制所有异步函数加 `_async` 后缀并重命名部分辅助函数。该版本移除此前标记弃用的全部功能,GCG 转为实验特性并提供新的公开 API,新增 Round Robin Target、Realtime 流式会话与服务端打断攻击以及图像转换器,还加入 VLGuard、StrongREJECT、Agent Threat Rules 等多个数据集加载器和 Python 3.14 支持,并修复 38+ 个依赖项漏洞及特定 CVE。

  12. Microsoft PyRIT 版本发布 · 收录 · 原文 29

    Microsoft PyRIT v1.0.0 发布:确立 v1 架构并引入破坏性变更

    Microsoft PyRIT 发布 v1.0.0,确立场景、攻击技术、执行器、注册表、标识符与记忆的 v1 架构,并包含有意的破坏性变更。场景策略更名为 techniques,组件构建统一走 BuildableRegistry,PromptConverter 改为 Converter,会话状态从 MessagePiece 迁至新的 Conversation 模型,0.15 及此前弃用的兼容层被移除。

  13. Microsoft PyRIT 版本发布 · 收录 · 原文 15

    PyRIT v1.0.1 修复结构化拒答处理

    Microsoft PyRIT 发布 v1.0.1 补丁,修复 OpenAI Responses 与 Chat Completions 返回结构化拒答时被误判为解析/运行时失败的问题。此前目标模型的拒答会导致攻击目标未完成并抛出误导性的 ValueError,现在拒答会被正常记录和评分,真正的部分执行则抛出 ScenarioPartialFailureException。使用 OpenAIResponseTarget 或 OpenAIChatTarget 对接近期 OpenAI 与 Azure OpenAI 模型的用户应升级;该版本还调整了推理模型响应片段顺序,将 reasoning 排在 text 之后。

  14. Microsoft PyRIT 版本发布 · 收录 · 原文 41

    微软 PyRIT 发布 v1.1.0,扩展扫描器与评分能力

    微软开源红队框架 PyRIT 发布 v1.1.0,重点改进评分机制、扩展扫描器能力并加入 CoPyRIT 新功能,Python 支持范围仍为 >=3.10、<3.15。评分方面新增未确定分数状态,读取 score_value 或调用 get_value() 前需检查 score.is_undetermined,部分被拦截的回复默认纳入评分,可通过 should_score_blocked_content=False 恢复旧行为。扫描器新增 Best-of-N、split-payload、多语言、音频 achilles、包幻觉、system-prompt 提取和 FigStep 等能力,并加入 bijection、CharNoise、CodeAttack、SATA、Vigenere、Acrostic、IPA 等 10 个转换器。官方称本次没有已知高优先级安全问题。

  15. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 25

    腾讯 AI-Infra-Guard v4.5.1 发布:新增多种多轮越狱攻击与 MCP 安全检测规则

    腾讯 AI-Infra-Guard 发布 v4.5.1,PromptSecurity 新增 Many-Shot、PAIR、GOAT 和 ActorAttack 多轮越狱攻击。Agent-Scan 新增 5 项 OWASP 检测技能(含 agentic-supply-chain、cascading-failure、human-agent-trust、inter-agent-comm、unexpected-code-execution)及 web-exfiltration-detection 技能,MCP-Scan 新增硬编码密钥、不安全反序列化等 4 条 MCP 安全检测规则,并更新 AIG 规则至 2026-07-24。

  16. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 24

    腾讯 AI-Infra-Guard v4.6.0 发布:新增 API Checker 与 LLM API 投毒检测

    腾讯 AI-Infra-Guard 发布 v4.6.0,新增 API Checker 模块提供 API 安全审计并集成 Web 代理与统一 CLI 命令,同时加入针对 LLM API 投毒攻击的新检测能力。Agent-Scan(aig-agent-redteam)升级到 v5.0.0,重构变异引擎并将 workflow-attack 合并入 mutation-attack,还完成了 DeepSeek Harness 提示注入评估的研究工作。此外修复了 MCP 客户端迁移至 SDK 2.0、streamable_http_client 头参数兼容等问题,文档中组件表更新且 CVE 计数从 1900+ 升至 2000+。

  17. MITRE ATLAS 数据发布 · 收录 · 原文 35

    MITRE ATLAS v5.6.0 更新:新增 AI 智能体配置搜索等攻击技术

    MITRE ATLAS 发布 v5.6.0,新增三项攻击技术:获取公开 AI 制品下的 AI Agent 配置搜索、搜索开放网站/域名下的代码仓库,以及钓鱼下的 Deepfake 辅助钓鱼。同时更新了钓鱼、LLM 越狱与缓解措施,涉及用户培训、Deepfake 检测,并更新了 OpenClaw 通过提示注入实现命令与控制等案例研究。

  18. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 15

    腾讯 AI-Infra-Guard v4.6.2 新增 FORGE-Bench 失控基准

    腾讯 AI-Infra-Guard 发布 v4.6.2,新增面向自主智能体的确定性失控基准 FORGE-Bench(forge_bench)及干净的 RogueHandoff-20 基准,并补充一批 AIG 检测规则。该版将 aig-skill-scan 升级到 0.2.2,减少无证据误报、避免模型工具调用卡死并约束流式中断响应,同时修正判定与公开结果的比对逻辑。Extract-Vuln 模块剥离 CDATA 包装并兼容常见标签别名,另清理了 12 处 YAML 校验失败等问题。

  19. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 14

    腾讯 AI-Infra-Guard v4.6.3 发布

    腾讯 AI-Infra-Guard 发布 v4.6.3,新增 DeepTeam 在运行期间将完成的测试用例写入磁盘,并修复 API Checker 对 Claude 5 签名的支持。该版本为 API Checker 补充失败指纹样本以提升模型识别可靠性,同时为 Prompt-Eval 加入限流感知退避、熔断器和进程组终止机制,并在熔断器与模型间共享限流计数器、加固 Retry-After 解析。文档方面新增 FORGE-Bench 与 RogueHandoff-20 研究条目并同步至 8 种语言 README。