CIAware-Bench 衡量 AI 控制干预感知
AI 有时能察觉控制干预,但检测大多接近随机水平。感知能力取决于智能体、监控器和环境这三元组合。我们构建了 CIAware-Bench 来衡量控制干预感知。🧵
开源红队、评测与防护工具。
在这个话题内搜索或按分类筛选AI 有时能察觉控制干预,但检测大多接近随机水平。感知能力取决于智能体、监控器和环境这三元组合。我们构建了 CIAware-Bench 来衡量控制干预感知。🧵
感谢大家第一轮的反馈! 这是 Tern v0.2.1 的更新日志,由它自己生成,大约 10 分钟后发布 😬
v0.2.8 现已发布,包含大量修复以及最后一刻加入的功能:Notebook 支持!
https://github.com/Adversarial-Detection-Engineering/adeskills
https://medium.com/@danielhammon1/creating-a-malicious-ml-model-with-a-keras-lambda-layer-then-reverse-engineering-it-9f0f855ebebb
通过了我的博士资格答辩(论文开题)!特别感谢导师 David Wagner 和 Chuan Guo 在过去两年的大力支持。我们的 Meta-SecAlign-70B 在提示注入安全性和智能体(工具/网页)实用性上与 GPT-5(high)相当。3 个月内下载量达 1 万次!




一些前沿 AI 评估需要数亿 token,而每一次浪费的试验都有真实成本。 我们推出 optstop:我们的开源工具,能在估计已经精确的地方停止评估,在还不精确的地方继续运行。🧵
非常期待这个多模态红队智能体,由我出色的学生 @xun_aq @ZRChen_AISafety @MintongKang @jiaweizhang 和产业合作者 @MinzhouP @Shuang 领导!请来 ICLR 我们的海报前给出反馈!!@xun_aq 本人就在 ICLR 现场!
Excited to share ARMs, our adaptive red-teaming agent for multimodal models at #ICLR2026! ARMs orchestrates diverse multimodal attack strategies for policy-driven safety evaluation, achieving SOTA red-teaming performance with +52.1% average ASR improvement over prior baselines. See you on Sat. afternoon at the poster session! 🇧🇷📍 Sat, Apr 25, 2026 · 3:15 PM–5:45 PM Pavilion 4 · P4-#4015
UIUC 团队开源 DecodingTrust-Agent Platform(DTap),一个面向高级 AI Agent 红队的可控仿真平台,作者称其环境、工具与输出均可模拟和操控,不依赖外部 MCP 服务,便于规模化、可复现地评估 Agent 风险。平台模拟 14 个高风险领域的 50 多个真实环境,Agent 接口参照官方 MCP 与 GUI 复刻,环境为全栈、可交互且可并行。团队同时发布 DTap-Bench,包含约 7K 个 Agent 红队任务和约 4K 个有策略依据的恶意目标,每个任务覆盖环境、工具、技能、提示词层面的注入及其组合,并配有可验证的判定器检查环境中的实际后果。团队称用该基准评测了主流 Agent 框架与基座模型,发现系统性漏洞与零日问题。论文、平台与代码链接已公开。
AI agents are already going wild, but today’s red-teaming tools for them are still like toys 😢 🔥👽 After spending 20 months and $120K API credits, we are excited to finally open-source DecodingTrust-Agent Platform (DTap): the first controllable, realistic simulation platform for advanced AI agent red-teaming !! 🌍 DTap simulates 50+ real-world environments across 14 high-stakes domains, with realistic agent interfaces replicated from their official MCPs and GUIs. The environments are full-stack, interactive, fully parallelizable, and can be easily configured to reproduce arbitrary real-world attack scenarios, making agent red-teaming scalable and highly transferable to deployment settings. 🔥We also release DTap-Bench, a large-scale benchmark with ~7K agent red-teaming tasks and ~4K policy-grounded malicious goals. Each red-teaming task includes a sophisticated attack sequence across environment-, tool-, skill-, prompt-level injections, as well as their compositions, plus a handcrafted verifiable judge that checks the actual consequences in the environment. Using DTap-Bench, we evaluate popular agent frameworks and backbone models across diverse policies, risks, threat models, and attack strategies, revealing systematic vulnerabilities and zero-days in today’s agents! Paper link: https://arxiv.org/pdf/2605.04808 Platform + benchmark + code: https://decodingtrust-agent.com Join our Discord: https://discord.gg/V4fG6NcVc Read more below 👇
推荐理由DTap 把 Agent 红队环境做成可完全操控的沙箱,并配套约 7K 任务基准,便于复现和迁移到部署场景。
当 AI 生成内容变得如此逼真,我们如何验证哪些是人、机器或自然创造的? 我们在播客中探讨溯源的重要作用——以及不可感知的水印如何保护数字媒体和生物设计。↓ 时间轴: 00:00 介绍 00:34 什么是水印? 04:35 SynthID 15:16 图像与视频 19:28 SynthID Bio 28:00 韧性的未来
Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。Observability 提供 Explorer、Judges、Campaigns 与 Datasets 等能力,用于流量检查、规模化评估和回归追踪;Agent Runtime 基于 Temporal 构建有状态、容错的执行环境,支持重试与长任务;AI Registry 统一管理 agents、模型、数据集、judges、工具与工作流的版本、血缘和访问控制。平台支持混合、专用和自托管部署。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 整体胜率,并已驱动 Mistral AI Studio 中的 Document AI Playground。该模型支持带 HTML 表格重建的 markdown 输出,定价为每 1,000 页 $2,Batch-API 折扣后降至 $1,模型标识为 mistral-ocr-2512,与 Mistral OCR 2 完全向后兼容,并提供自托管选项。
Mistral 发布 Leanstral,首个专为 Lean 4 设计的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并上线 Mistral vibe 的 agent 模式与免费 API。在 FLT 项目 PR 的 FLTEval 基准上,Leanstral pass@2 得分 26.3,超过 Sonnet 2.6 分而成本仅 36 美元(Sonnet 为 549 美元),pass@16 达 31.9;对比开源模型,GLM5-744B-A40B 与 Kimi-K2.5-1T-32B 分别止步约 16.6 和 20.1。该模型支持任意 MCP,并针对 lean-lsp-mcp 专门训练。
Mistral 在 Studio 发布 Connectors,内置连接器与自定义 MCP 均可通过 API/SDK 用于所有模型和智能体调用,并新增直接工具调用与 human-in-the-loop 审批流程。连接器以 MCP 协议打包为可复用实体,集中注册后可在 LeChat 和 AI Studio 中使用,支持 Conversation API、Completions API 和 Agent SDK,用于对接 CRM、知识库等企业系统。
Mistral 将编码智能体迁移至云端,通过 Mistral Vibe CLI 或 Le Chat 启动可并行运行的异步编码会话,本地会话也可"传送"上云继续执行。驱动这一能力的是新旗舰模型 Mistral Medium 3.5,128B 稠密模型、256k 上下文窗口,以修改版 MIT 许可开放权重,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,取代 Devstral 2 成为 Vibe CLI 默认模型。Le Chat 同步推出 Work 模式预览,由新智能体驱动多步骤任务并默认开启连接器。该模型按每百万输入 token 1.5 美元、每百万输出 token 7.5 美元计价,已在 Pro、Team 和 Enterprise 套餐上线。
Mistral 发布 Apache-2.0 许可的 Leanstral 1.5,总参数 119B、激活参数 6B,在 miniF2F 上达到 100%,PutnamBench 解出 587/672 题,FATE-H 与 FATE-X 分别取得 87% 和 34% 的 SOTA。该模型经 mid-training、监督微调与 CISPO 强化学习三阶段训练,在 57 个代码仓库中发现 5 个此前未知的 bug,FLTEval 上 pass@1 从 21.9 提升至 28.9。模型已完全开源,可通过 Hugging Face 和免费 API 使用。
Mistral Studio 现已向客户提供 Prompts 和 Skills 的集中管理系统,将每个提示词和技能作为可追踪、可版本化的资产,具备不可变版本、回滚、明确归属、分类标签和审计日志。资产通过标签从 staging 晋升到 production,仍触发企业已有的 CI/CD(如通过 SDK 接入 GitHub Actions),非开发者的业务团队也能直接迭代生产指令。借助 Observability 的 lineage 和遥测,生产输出可回溯到对应资产版本,智能体运行的 skills 以 MCP 服务器形式直接暴露,确保执行的是受治理的同一资产。
对自研政务 RAG 系统 gov-rag-demo 的白盒代码审计发现 4 类真实缺陷:间接提示注入、权限参数客户端可控、会话 ID 无鉴权、政务高频实体脱敏不足,均定位到行号并完成修复。修复后 78 条业务评测用例保持 100% 零回归,安全专项断言全部通过。材料附完整复现脚本与修复后状态。
OWASP GenAI LLM TOP 10 2026 的中文民间翻译版本发布,梳理了大语言模型应用面临的十大安全风险。该清单由 OWASP 发布,是 AI 安全领域被广泛引用的风险分类基准。此次翻译为中文读者提供了 2026 版风险条目的对照参考。
HostTraceAI 尝试把 AI Agent 引入应急响应中的主机溯源流程,用权限分级与接入机制回答"凭什么让 AI 动生产主机"。该工具面向被植入木马或 WebShell 的服务器排查场景,覆盖进程、服务、启动项、计划任务、网络连接、文件变更和登录活动等取证环节,目标是把原本依赖手工敲命令、截图和翻终端历史的重复流程变得可复现、少遗漏。