跳到正文

工具与开源

开源红队、评测与防护工具。

479条动态与论文相关主题红队防御与护栏安全评测
在这个话题内搜索或按分类筛选

新闻与论文

第 401–420 条 · 共 479 条
10月1日周四
  1. Microsoft PyRIT 版本发布 · 收录 · 原文 15

    Microsoft PyRIT v0.13.0 发布

    Microsoft PyRIT 发布 v0.13.0,将 TargetCapabilities 替换为 TargetConfiguration,并引入新的 AttackTechnique 抽象来标准化攻击参数的声明与消费方式,同时移除多个弃用功能,属破坏性更新。该版本还新增 TargetRequirements、AttackTechniqueRegistry,并为 OpenAIChatTarget 默认启用图像输入,加入 VisualLeakBench 数据集加载器及符合 ISO 42001 的危害定义。

  2. Microsoft PyRIT 版本发布 · 收录 · 原文 20

    Microsoft PyRIT v0.14.0 发布

    Microsoft PyRIT 发布 v0.14.0,将 Message、Score、Seed 类及 Identifier 等核心模型迁移到 Pydantic v2,构造改为仅限关键字参数并拒绝额外字段,同时强制所有异步函数加 `_async` 后缀并重命名部分辅助函数。该版本移除此前标记弃用的全部功能,GCG 转为实验特性并提供新的公开 API,新增 Round Robin Target、Realtime 流式会话与服务端打断攻击以及图像转换器,还加入 VLGuard、StrongREJECT、Agent Threat Rules 等多个数据集加载器和 Python 3.14 支持,并修复 38+ 个依赖项漏洞及特定 CVE。

  3. Microsoft PyRIT 版本发布 · 收录 · 原文 29

    Microsoft PyRIT v1.0.0 发布:确立 v1 架构并引入破坏性变更

    Microsoft PyRIT 发布 v1.0.0,确立场景、攻击技术、执行器、注册表、标识符与记忆的 v1 架构,并包含有意的破坏性变更。场景策略更名为 techniques,组件构建统一走 BuildableRegistry,PromptConverter 改为 Converter,会话状态从 MessagePiece 迁至新的 Conversation 模型,0.15 及此前弃用的兼容层被移除。

  4. Microsoft PyRIT 版本发布 · 收录 · 原文 15

    PyRIT v1.0.1 修复结构化拒答处理

    Microsoft PyRIT 发布 v1.0.1 补丁,修复 OpenAI Responses 与 Chat Completions 返回结构化拒答时被误判为解析/运行时失败的问题。此前目标模型的拒答会导致攻击目标未完成并抛出误导性的 ValueError,现在拒答会被正常记录和评分,真正的部分执行则抛出 ScenarioPartialFailureException。使用 OpenAIResponseTarget 或 OpenAIChatTarget 对接近期 OpenAI 与 Azure OpenAI 模型的用户应升级;该版本还调整了推理模型响应片段顺序,将 reasoning 排在 text 之后。

  5. Microsoft PyRIT 版本发布 · 收录 · 原文 41

    微软 PyRIT 发布 v1.1.0,扩展扫描器与评分能力

    微软开源红队框架 PyRIT 发布 v1.1.0,重点改进评分机制、扩展扫描器能力并加入 CoPyRIT 新功能,Python 支持范围仍为 >=3.10、<3.15。评分方面新增未确定分数状态,读取 score_value 或调用 get_value() 前需检查 score.is_undetermined,部分被拦截的回复默认纳入评分,可通过 should_score_blocked_content=False 恢复旧行为。扫描器新增 Best-of-N、split-payload、多语言、音频 achilles、包幻觉、system-prompt 提取和 FigStep 等能力,并加入 bijection、CharNoise、CodeAttack、SATA、Vigenere、Acrostic、IPA 等 10 个转换器。官方称本次没有已知高优先级安全问题。

  6. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 21

    腾讯 AI-Infra-Guard v4.1.15 发布:新增 3 条 MCP 威胁检测规则与 6 条 llama.cpp CVE 规则

    腾讯 AI-Infra-Guard 发布 v4.1.15,在 mcp_scan 和 ai_infra_scan 中允许省略 model token,回退到系统默认模型。MCP 模块新增工具投毒、凭据窃取、命令注入 3 条威胁检测规则,llama-cpp 规则包新增 6 条 llama.cpp CVE 规则,其漏洞总数由 3 更新为 9、严重级别由 Low 调整为 Medium-High。文档同步将 ai-infra-scan 漏洞总数由 1300+ 修正为 1600+,openclaw 漏洞数由 628 更新为 655。

  7. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 27

    腾讯 AI-Infra-Guard v4.5.0 发布:Agent-Scan、MCP-Scan、Skill-Scan 模块化并新增检测能力

    腾讯 AI-Infra-Guard 发布 v4.5.0,将 Agent-Scan、MCP-Scan、Skill-Scan 模块化为独立 CLI 并支持 AIG 集成。Agent-Scan 新增 4 项 AI 智能体安全检测技能,MCP-Scan 新增 2 条 MCP 安全检测规则及 ATR 衍生规则,Skill-Scan 新增 Agent Skill 安全审计并以 PyPI 包 aig-skill-scan 发布,支持 SARIF 2.1.0 输出。同时新增 agentic-tool-misuse 评测数据集,CVE 规则数更新至 1900+。

  8. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 25

    腾讯 AI-Infra-Guard v4.5.1 发布:新增多种多轮越狱攻击与 MCP 安全检测规则

    腾讯 AI-Infra-Guard 发布 v4.5.1,PromptSecurity 新增 Many-Shot、PAIR、GOAT 和 ActorAttack 多轮越狱攻击。Agent-Scan 新增 5 项 OWASP 检测技能(含 agentic-supply-chain、cascading-failure、human-agent-trust、inter-agent-comm、unexpected-code-execution)及 web-exfiltration-detection 技能,MCP-Scan 新增硬编码密钥、不安全反序列化等 4 条 MCP 安全检测规则,并更新 AIG 规则至 2026-07-24。

  9. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 21

    腾讯 AI-Infra-Guard v4.5.2 发布:新增 SkillJack 项目并修复 mcp-scan 提示注入致 RCE

    腾讯 AI-Infra-Guard 发布 v4.5.2,新增 SkillJack 项目和一批 AIG 检测规则,并为 Qdrant、Chroma、Weaviate 补充仅 GET 指纹识别。该版修复了 mcp-scan 动态扫描模式下经提示注入触发的远程代码执行问题,同时修补 skill-scan 字符集内容走私及隐藏编译字节码两处缺陷,并将 aig-agent-redteam 变异引擎重构到 v5.0.0、合并工作流攻击与变异攻击流程。

  10. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 24

    腾讯 AI-Infra-Guard v4.6.0 发布:新增 API Checker 与 LLM API 投毒检测

    腾讯 AI-Infra-Guard 发布 v4.6.0,新增 API Checker 模块提供 API 安全审计并集成 Web 代理与统一 CLI 命令,同时加入针对 LLM API 投毒攻击的新检测能力。Agent-Scan(aig-agent-redteam)升级到 v5.0.0,重构变异引擎并将 workflow-attack 合并入 mutation-attack,还完成了 DeepSeek Harness 提示注入评估的研究工作。此外修复了 MCP 客户端迁移至 SDK 2.0、streamable_http_client 头参数兼容等问题,文档中组件表更新且 CVE 计数从 1900+ 升至 2000+。

  11. MITRE ATLAS 数据发布 · 收录 · 原文 35

    MITRE ATLAS v5.6.0 更新:新增 AI 智能体配置搜索等攻击技术

    MITRE ATLAS 发布 v5.6.0,新增三项攻击技术:获取公开 AI 制品下的 AI Agent 配置搜索、搜索开放网站/域名下的代码仓库,以及钓鱼下的 Deepfake 辅助钓鱼。同时更新了钓鱼、LLM 越狱与缓解措施,涉及用户培训、Deepfake 检测,并更新了 OpenClaw 通过提示注入实现命令与控制等案例研究。

  12. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 15

    腾讯 AI-Infra-Guard v4.6.2 新增 FORGE-Bench 失控基准

    腾讯 AI-Infra-Guard 发布 v4.6.2,新增面向自主智能体的确定性失控基准 FORGE-Bench(forge_bench)及干净的 RogueHandoff-20 基准,并补充一批 AIG 检测规则。该版将 aig-skill-scan 升级到 0.2.2,减少无证据误报、避免模型工具调用卡死并约束流式中断响应,同时修正判定与公开结果的比对逻辑。Extract-Vuln 模块剥离 CDATA 包装并兼容常见标签别名,另清理了 12 处 YAML 校验失败等问题。

  13. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 14

    腾讯 AI-Infra-Guard v4.6.3 发布

    腾讯 AI-Infra-Guard 发布 v4.6.3,新增 DeepTeam 在运行期间将完成的测试用例写入磁盘,并修复 API Checker 对 Claude 5 签名的支持。该版本为 API Checker 补充失败指纹样本以提升模型识别可靠性,同时为 Prompt-Eval 加入限流感知退避、熔断器和进程组终止机制,并在熔断器与模型间共享限流计数器、加固 Retry-After 解析。文档方面新增 FORGE-Bench 与 RogueHandoff-20 研究条目并同步至 8 种语言 README。

  14. MITRE ATLAS 数据发布 · 收录 · 原文 12

    MITRE ATLAS 发布 v2026.05:知识与数据格式拆分版本号并引入 v6.0.0 格式

    MITRE ATLAS 从本次发布开始将知识库内容与数据格式分开管理版本:月度内容更新改用 YYYY.MM.N 方案并把版本存入 Collection 对象,格式变更则沿用语义化版本。此次内容版 v2026.05 给所有技术条目补充了一个或多个运行平台字段(预测式 AI、生成式 AI、智能体 AI、企业);同时推出的格式 v6.0.0 新增 ATLAS YAML 结构,提供 Pydantic schema 校验、SQLAlchemy ORM 持久化和 FastAPI REST API,并将历史版本迁移保存于 dist/legacy/ 与 dist/v6/。

  15. MITRE ATLAS 数据发布 · 收录 · 原文 43

    MITRE ATLAS 发布 v2026.06,新增窃取 Web 会话 Cookie 技术与多起 AI 攻击案例

    MITRE ATLAS 发布 v2026.06 数据更新,新增“窃取 Web 会话 Cookie”和“使用替代认证材料:Web 会话 Cookie”两项技术,并更新了 AI 服务 Web 界面相关条目。现有技术 LLM Jailbreak 与缓解措施 Generative AI Guardrails、Generative AI Guidelines、AI Telemetry Logging 也得到更新。

  16. MITRE ATLAS 数据发布 · 收录 · 原文 43

    MITRE ATLAS 发布 v2026.07 数据,新增 AI Agent 工具投毒等技术条目

    MITRE ATLAS 发布 v2026.07 数据版本,包含 1 个矩阵、16 项战术、101 项技术、77 项子技术、37 项缓解措施和 68 个案例研究。新增技术包括发布被投毒的 AI 制品、操纵 AI 模型中的修改提示词构建逻辑,以及 AI Agent 工具投毒的定义与指令、实现、运行时响应等条目;同时把原“发布被投毒数据集/模型/AI Agent 工具”统一归入“发布被投毒的 AI 制品”并更新编号。缓解措施方面新增 AI 红队、限制 AI 工作负载资源消耗等,并将多项原有措施改名为生成式 AI 模型对齐、预测式 AI 模型加固等。

  17. MITRE ATLAS 数据发布 · 收录 · 原文 43

    MITRE ATLAS 发布 v2026.08:新增自主攻击与 AI 智能体相关技术与缓解措施

    MITRE ATLAS 发布 v2026.08 数据版本,包含 1 个矩阵、16 项战术、114 项技术、83 项子技术、39 项缓解措施和 72 个案例研究。ATLAS 是基于真实攻击观测与 AI 红队演示构建的 AI 对抗战术与技术知识库,覆盖针对 AI 系统的攻击、AI 能力滥用以及 AI 实质性促成的有害自主行为。

  18. MITRE ATLAS 数据发布 · 收录 · 原文 43

    MITRE ATLAS 发布 v2026.09 数据更新,新增多项 Agent 与多模态攻击技术

    MITRE ATLAS 发布 v2026.09 数据版本,包含 1 个矩阵、16 项战术、120 项技术、88 项子技术、40 项缓解措施和 73 个案例研究。新增技术涵盖多模态输入中的触发器、AI Agent 响应偏置、伪造 AI 助手链接、配置错误或公开暴露的 AI 服务、发现 AI Agent 运行时能力、AI 定向隐蔽以及针对 AI 基础设施的主动扫描等。更新了 LLM 提示混淆、间接 LLM 提示注入、LLM 越狱、LLM 响应渲染和 AI Agent 点击诱饵等技术。缓解措施新增 AI 蜜罐,更新生成式 AI 护栏。

  19. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 15

    NVIDIA NeMo Guardrails v0.21.0 发布:新增并行执行输入/输出护栏引擎 IORails

    NVIDIA NeMo Guardrails 发布 v0.21.0,引入优化后的输入/输出护栏引擎 IORails,支持并行执行 NemoGuard 的内容安全、话题安全和越狱检测三类护栏,并带日志记录与请求 ID。该版本还新增 LLMRails.check_async 方法实现独立的输入/输出护栏校验,使护栏服务器兼容 OpenAI(含新的 v1/models 端点),并通过 GuardrailsMiddleware 接入 LangChain 智能体。社区集成方面加入 PolicyAI 内容审核、CrowdStrike AIDR 及基于正则表达式的检测护栏,同时将嵌入索引初始化改为惰性加载以改善启动性能。