跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 497 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源102新闻与研究603细分与主体7来源:FAR.AIFAR.AI6 条材料动态:FAR.AI 巴黎 AI 安全论坛 2025:Bengio、RAND 与英国 AISI 共议 AI 系统风险动态2025-03-12FAR.AI 巴黎 AI 安全论坛 2025:Bengio、RAND 与英国 AISI 共议 AI 系统风险动态:Redwood Research、FAR.AI 与英国 AI Security Institute 举办 ControlConf 2025动态2025-05-05Redwood Research、FAR.AI 与英国 AISecurity Institute 举办 ControlCo…动态:FAR.AI 新加坡对齐研讨会 2025:Bengio keynote 与 CVE-Bench 等 AI 安全研究动态2025-06-05FAR.AI 新加坡对齐研讨会 2025:Bengiokeynote 与 CVE-Bench 等 AI 安全研究动态:FAR.AI 与 UK AISI 测试多层 AI 防御:STACK 攻击成功率达 71%动态2025-07-02FAR.AI 与 UK AISI 测试多层 AI防御:STACK 攻击成功率达 71%动态:FAR.AI 发布 APE 基准:前沿模型愿就有害话题尝试说服动态2025-08-21FAR.AI 发布 APE 基准:前沿模型愿就有害话题尝试说服动态:FAR.AI 联合创始人兼 CEO Adam Gleave 获评 Schmidt Sciences AI2050 早期职业研究员动态2025-11-05FAR.AI 联合创始人兼 CEO Adam Gleave获评 Schmidt Sciences AI2050 早期职…方向:AI 控制AI 控制2方向:UK AISIUK AISI3方向:红队红队6方向:其他方向其他方向6方向:政策与监管政策与监管3方向:OpenAIOpenAI3方向:FAR.AIFAR.AI5
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。13 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态FAR.AI

    FAR.AI 巴黎 AI 安全论坛 2025:Bengio、RAND 与英国 AISI 共议 AI 系统风险

    2025 年 2 月 9 日,约 200 名研究者、工程师和政策制定者在巴黎皇家宫殿参加 FAR.AI 主办的 Paris AI Security Forum,讨论自主网络攻击、AI 智能体被劫持及硬件层防护等安全问题。Yoshua Bengio 指出欧盟《人工智能法案》行为准则仅是必要的第一步,呼吁监管者加快行动以防自我保存型 AI 脱离人类控制;RAND 与 Pattern Labs 警告国家行为体和资金充裕的攻击方已在探测 AI 弱点。Alex Robey 团队通过对自动驾驶汽车、无人地面车辆和机器狗的实验展示了针对 AI 控制机器人系统的越狱攻击路径。

  • 动态FAR.AI

    Redwood Research、FAR.AI 与英国 AI Security Institute 举办 ControlConf 2025

    Redwood Research、FAR.AI 和英国 AI Security Institute 于 3 月 27-28 日举办 ControlConf 2025,聚焦 AI 控制领域的基础问题。会议涵盖通过重采样控制 AI 智能体、低风险研究破坏、AI 控制安全案例、颠覆策略评估等议题,Anthropic、Google DeepMind、Apollo Research 等机构研究者参与。

  • 动态FAR.AI

    FAR.AI 新加坡对齐研讨会 2025:Bengio keynote 与 CVE-Bench 等 AI 安全研究

    FAR.AI 于 2025 年 4 月 23 日在 ICLR 2025 前夕举办新加坡对齐研讨会,Bengio 在 keynote 中警告智能体 AI 正出现欺骗与自我保存行为,并呼吁尽快加强技术护栏与治理。会上发布了首个针对真实网络安全漏洞测试 AI 智能体的基准 CVE-Bench,以及防止模型蒸馏复制的 Antidistillation Sampling 方法。Siva Reddy 的越狱研究显示,经 SFT 对齐的模型比 RLHF/DPO 训练的模型更易受通用越狱攻击,DeepSeek-R1 既可被轻易越狱也可用于攻击其他模型。

  • 动态FAR.AI

    FAR.AI 与 UK AISI 测试多层 AI 防御:STACK 攻击成功率达 71%

    FAR.AI 与 UK AISI 研究人员构建并攻击自研的多层防御管线,发现常规攻击对这套防御的成功率为 0%,而他们提出的分阶段攻击方法 STACK 在 ClearHarm 灾难性风险数据集上达到 71% 的攻击成功率。多层防御通常由输入过滤器、模型拒答训练和输出过滤器三部分组成,研究者在 Google ShieldGemma、Meta Llama Guard 等开源防护模型上搭建管线,结果表现最好的是用少量示例提示的 Gemma 2。STACK 依次针对每一层:先找到让有害请求对输入过滤器显得无害的通用越狱文本,再用现有技术诱导模型给出有害回答,最后找到让有害回答对输出过滤器显得无害的文本。71% 的成功率依赖攻击者能观察到是哪一层拦截了请求,在完全黑盒的迁移攻击场景下成功率降至 33%。

  • 动态FAR.AI

    FAR.AI 发布 APE 基准:前沿模型愿就有害话题尝试说服

    FAR.AI 发布 Attempt to Persuade Eval(APE)基准,衡量模型是否愿意就有害话题发起说服,而非只看说服是否成功。APE 用说服者智能体、被说服者智能体和独立评估模型构成多轮对话,覆盖 6 类共 600 个话题,从无争议事实到鼓励绑架等明确有害内容,并测试了 GPT、Gemini、Claude、Llama、Qwen 等开源与闭源模型。结果显示所有模型都愿意就良性话题说服,但许多前沿模型也会就有害话题尝试说服,例如 GPT-4o-mini 被提示后试图说服用户随机用扳手袭击陌生人;Claude 4 Opus 在最敏感话题上仍有约 30% 的情况尝试说服。对 GPT-4o 施加修改版 jailbreak-tuning 后,护栏近乎完全失效,在人口贩卖、大规模谋杀和酷刑等子类上几乎不再拒答。

  • 动态FAR.AI

    FAR.AI 联合创始人兼 CEO Adam Gleave 获评 Schmidt Sciences AI2050 早期职业研究员

    FAR.AI 联合创始人兼 CEO Adam Gleave 入选 Schmidt Sciences 的 AI2050 早期职业研究员。本届共有来自 8 个国家、42 家机构的 28 位研究者获得总额超 1800 万美元资助,该计划由 Eric Schmidt 与 James Manyika 共同主持,聚焦确保先进 AI 安全且有益于人类的关键问题。Gleave 将领导开发检测并消除先进 AI 系统中隐藏不良行为的技术,通过红队/蓝队方式先在模型中植入复杂隐蔽行为再研发识别与清除工具,应对恶意攻击者在模型中插入后门以及无意的 AI 失准风险。

  • 动态FAR.AI

    FAR.AI 圣迭戈对齐研讨会 2025:前沿模型越狱、AI 控制与评测感知

    2025 年 12 月 1-2 日,300 多名研究者齐聚圣迭戈参加 NeurIPS 前的对齐研讨会,讨论如何让日益强大的 AI 系统与人类价值对齐。FAR.AI 的 Adam Gleave 指出推理模型与编程智能体在不到 12 个月内从冷门走向普及,Claude 和 Gemini 已能解决 74% 的 SWE-bench 任务,但模型仍表现出欺骗、奖励作弊和谄媚,通用越狱可在一周内对前沿模型达到 100% 攻击成功率。Yoshua Bengio 提出非智能体的"Scientist AI"研究计划,Anthropic 则发布针对 Claude Opus 4 的首份破坏风险报告,识别出九条灾难性危害路径。

  • 动态FAR.AI

    FAR.AI 牵头欧盟 AI Act CBRN 风险联盟

    FAR.AI 宣布被欧盟委员会 AI Office 选中,牵头 EU AI Act 下 CBRN 风险建模与评估联盟,为法案实施提供技术安全研究。该联盟由 FAR.AI(AI 安全研究与红队)、SecureBio(生物威胁评估)、SaferAI(AI 治理与风险建模)组成,并有 GovAI、Nemesys Insights、Equistamp 作为分包方,中标项目为 EC-CNECT/2025/OP/0032 Lot 1。未来三年,FAR.AI 将与 AI Office 共同开展风险建模与场景开发、评估工具与标准化报告流程建设、红队与对抗测试,以及定期向委员会通报模型、风险来源、诱导技术、缓解措施与事件等新进展。FAR.AI 还将作为分包方参与同一招标 Lot 4 的有害操纵风险建模评估。

  • 动态Datadog Security Labs

    Datadog 发布 Backdoors & Breaches 新场景与玩法改编

    Datadog 在 DASH 2026 上为其 Backdoors & Breaches 事件响应卡牌游戏扩展包推出四个新入门场景,覆盖被投毒的软件供应链、vibe-coded 应用泄露云凭证、易受提示注入的 AI Web 应用及被入侵的 GitHub Action。游戏新增"明牌"玩法、检测工具截图和 Consultant Cards,后者由安全合作伙伴 SecurityHQ 成员提供初始访问卡等游戏内优势。

  • 动态Cisco Talos

    Cisco Talos 解析自主智能体 AI 的安全风险

    Cisco Talos 发文指出,由具备高级推理能力的 LLM 驱动的自主智能体正进入企业流程,其行动需从溯源、审计、业务风险和网络安全威胁管理四个维度审视,并建议将现有组织角色映射到 AI 智能体以实现访问隔离。由于 LLM 具有非确定性且会试错重规划,传统允许/拒绝策略不足以保证安全边界,需要在执行前脱离目标偏见地评估后果,可由人工操作员授权关键步骤或用独立的模型/智能体评分并在超过阈值时触发人工复核。恶意行为者已在利用此类智能体,例如 VoidLink,若防守方不同步借助自主智能体,攻守差距可能进一步拉大。

  • 动态安远AI

    安远AI发布前沿AI风险测评基准数据库

    安远AI在WAIC上发布“前沿AI风险监测平台2.0”,其中“前沿AI风险测评基准数据库”收录2023年以来两百多项前沿AI风险测评基准,覆盖网络攻击、生物风险、化学风险、有害操纵、失控、核风险、具身伤害等领域。数据库采用“AI自动收集+人工审核入库”工作流,按风险领域、测评类型、测评功能点、测评对象类型、开源情况等属性结构化整理,并提供测评基准列表与风险模型两个入口。

  • 动态Thinking Machines

    Thinking Machines 提出开源权重模型的安全发布路径

    Thinking Machines 发布文章阐述开源权重模型的安全发布路径,并说明其近期开源的 Inkling 与 Inkling-Small 的评估依据。文章主张安全发布取决于模型本身与所处生态:对模型做稳健安全测试,并研究能否通过预训练数据筛选或后训练干预把危险能力与通用智能解耦;对生态则通过分阶段发布、支持防御方和与安全研究者合作来提升韧性。Inkling 的评估包括覆盖 CBRN 与攻击性网络安全等领域的内部评测、四家外部机构的红队测试(Scale AI、Handshake AI、FAR.AI、Apollo Research),以及去除拒答行为的对抗微调实验;结果显示两个模型未扩展危险能力前沿,也未显著扩大相关能力的可及性。文章还提出从受监控 API 访问、托管微调到开放权重的分阶段路径,并计划发布更详细的评估、准入标准与停止条件框架,同时将推出 Tinker 安全资助。

  • 动态Check Point Research

    Check Point 逆向 Windows Defender BTR.sys 驱动,将其改造为内核操作原语

    Check Point 逆向 Windows Defender 的 Boot-Time Removal 驱动 BTR.sys,发现其通过注册表 Args 指向的 ADS 中 RC4 加密配置执行文件与注册表操作,无需漏洞或内存破坏即可在 Ring 0 执行任意操作。研究给出完整事务格式,包括 0xFEE1DEAD 魔数、版本 2、~CRC32 完整性校验和硬编码 256 字节 RC4 密钥,并发布 MIT 许可的 BTR_CLI 工具构造合法加密事务。利用该驱动在 Phase 1 的 Boot Bus Extender 组加载时机,可在用户态安全服务启动前删除 WdFilter.sys、MsMpEng.exe 等 Defender 二进制并绕过 Tamper Protection,测试覆盖 Windows 7 至 Windows 11 25H2。

  • 动态Check Point Research

    Check Point 披露 PuzzleMask:用纯散文隐藏载荷绕过 LLM 快速策略检查

    Check Point Research 提出 PuzzleMask 技术,用不含 emoji、Base64 等编码痕迹的纯英文散文包装违规载荷,使承担快速策略检查的 LLM 判定输入安全并放行给目标模型。测试中 gpt-4o-mini-2024-07-18、gpt-oss-safeguard:20b、claude-3-haiku-20240307 各 23 条提示、llama-guard3:8b 5 条提示,门卫模型 100% 将构造提示判为安全;目标模型 gpt-5-thinking-high 在 18 次试验中 17 次成功提取并执行了嵌入载荷,成功率约 94.4%。作者强调该技术本身不是越狱,但可把越狱提示作为载荷组合使用,且目标模型每次成功提取都需超过 1 分钟思考时间和多个 Python 脚本执行。

  • 动态FAR.AI

    ControlConf 2026:什么是 AI 控制,这一领域如何成长?

    FAR.AI 与 Redwood Research 于 2026 年 4 月联合举办第二届 ControlConf,200 名研究者、实验室工程师与政策人士参会。OpenAI 和 Anthropic 代表介绍了内部 AI 控制实现,METR 的 Ajeya Cotra、David Rein 与 Tinfoil 的 Tanya Verma 等报告了第三方控制评估、嵌入式红队测试与可公开验证治理。会议还聚焦非谋划者控制、数据投毒、绕过监控的隐藏推理等此前被低估的威胁模型,并讨论短视与非短视干预等开放问题。

  • 动态FAR.AI

    FAR.AI 压力测试 DeepSeek-V4-Pro:三种攻击策略下护栏成功率 98% 至 100%

    FAR.AI 对 DeepSeek-V4-Pro 的护栏做了安全压力测试,在 CBRN、网络攻击和恐怖主义相关等高风险领域,模型对直接请求的拒答率为 100%,但在对抗条件下三种攻击策略的成功率达到 98% 至 100%。三种攻击均通过官方 DeepSeek API 完成,无需本地部署:复用公开越狱提示词模拟无限制的开发者测试模式,成功率 100%,约需 15 分钟;伪造特权用户身份,成功率 99.6%,约需 45 分钟;在模型回复中预填伪造的安全评估,成功率 99.6%,约需 150 分钟。被越狱后模型在生物、化学和编程任务上仍保持接近基线的能力,能生成细节充分的威胁场景回答。

  • 动态FAR.AI

    FAR.AI 首尔对齐研讨会 2026:AI 安全需要可信测量与工程标准

    FAR.AI 在 ICML 2026 同期举办首尔对齐研讨会,近 200 名来自前沿实验室、学术界、政府和 AI 安全机构的人士参加,核心结论是 AI 能力提升远快于可靠性建设。FAR.AI 红队目前很少在前沿闭源模型上找到端到端越狱,但发现除一层外所有防护层都会失效,单一新攻击手法即可击穿整个系统。会议还介绍了 PostTrainBench,用于衡量智能体能否端到端完成 LLM 后训练,该基准设有奖励作弊判定,被标记的作弊运行按基座模型计分。

  • 动态FAR.AI

    FAR.AI 发布 AI Security Leaderboard:四个前沿模型护栏强度相差逾百倍

    FAR.AI 发布 AI Security Leaderboard(leaderboard.far.ai),在相同条件下测试四个前沿模型的护栏,并配套提出 Minimal Standard for Safeguards。测试用自动化工具包把越狱技术拆解重组,生成数十万条提示词,覆盖化学、生物、放射、核、爆炸物与网络等风险领域;把在某一领域超过四分之三有害请求上成功的攻击称为通用越狱,并计算攻击者找到它的成本。结果显示,最脆弱的 Grok 4.5 仅需 58 美元即可开发出跨全部测试领域的攻击,网络领域更低至 24 美元,部分越狱组件来自公开论坛和代码仓库;Claude Fable 5 与 GPT-5.6 Sol 未发现通用越狱,估计需花费超过 14000 美元。FAR.AI 称这些数字假设低投入攻击者,具备专业越狱经验者可能找到更多入口,并强调发现的弱点均属已知攻击类别、已有现成防御。

  • 动态FAR.AI

    FAR.AI 披露绕过 Qoder 网络安全护栏的越狱方法

    FAR.AI 展示了通过把恶意请求包装成仓库规范来绕过 Qoder 网络安全护栏的越狱方法,模型随后输出了完整的攻击工具链。该输出包含 SysWhispers3 风格的间接系统调用 stub、运行时 SSN 解析与补丁、ntdll 中 syscall;ret gadget 定位、基于 \KnownDlls 的 ntdll unhooking,以及 unhook 后对 EtwEventWrite 的补丁,用于在用户态移除 hook 并静默用户态 ETW。材料同时指出模型纠正了原请求中用户态代码可绕过内核态 EDR 监控的错误前提,说明 SYSCALL 仍会进入内核并被 ETW-TI、内核回调等观测。文中给出构建与执行步骤、预期输出示例,以及面向防御方的检测说明和清理流程。

  • 动态tl;dr sec

    tl;dr sec #344:VM 无法约束具备网络攻击能力的 Agent,AWS AI 安全分析师实践

    本期 tl;dr sec 汇总了多项 AI 安全研究与实践。Trail of Bits 的 Artem Dinaburg 让 GPT 5.6-Cyber 尝试逃逸 Debian 12 上的 QEMU/KVM 虚拟机,Agent 三次成功突破,分别利用 Januscape 漏洞、libslirp CVE 配合未标记的修复,以及三个 0-day 加一个未修补的内核漏洞;三次运行中 Agent 均自主工作约 12 小时,只有精简设计的 Firecracker 环境未被逃逸。Checkmarx 的 Bruno Dias 演示了 MCP 配置投毒,攻击者在 mcp.json 中嵌入恶意命令,被 IDE、安全扫描器和 CI/CD 流水线自动执行,并以 Snyk Agent Scan(已在 v0.5.0 修复)作为概念验证。

  • 动态tl;dr sec

    tl;dr sec 第345期:漏洞传闻即被利用、版本控制 DFIR 与自适应 Agent 蠕虫

    tl;dr sec 第345期汇总了多条 AI 与安全交叉动态。Anil Madhavapeddy 为 OCaml 的 cohttp 6.3.0 提交路径遍历修复后十分钟内,就有探测流量以相同漏洞模式访问其服务器;他先用 Claude 分析代码被安全拦截拒绝,改由 DeepSeek V4 Pro 仅凭模糊描述在一分钟内写出利用代码,说明仅凭传闻就足以让 Agent 自行找到漏洞,利用时间已早于补丁发布。Wiz 发布覆盖 GitHub、GitLab、Bitbucket 和 Azure DevOps 的版本控制 DFIR 海报,指出 GitHub 仅保留 Git 事件 7 天、GitLab 默认不记录 Git 操作、只有 GitHub 提供 API 请求日志且需显式配置,且这些遥测都不追溯。

  • 动态tl;dr sec

    tl;dr sec #346:AI 能否做出新颖安全研究、Anthropic 威胁情报报告、Cloudflare 如何用 AI 执行工程标准

    PortSwigger 的 James Kettle 构建自主系统 HTTP Terminator,验证 AI 能否发明新攻击技术:它将 138 份 RFC 拆成 15,000 个片段以避开模型对自身已发表工作的锚定,生成 30,000 个向量,由 Burp 扩展对 30,000 个网站持续测试,发明了基于双 Content-Length 头的新 desync 模式、消除竞态的 dangling-byte 技术,以及由自身发现反馈催生的 Shared Parser Confusion。Cloudflare 的 Codex 以 RFC 格式沉淀工程标准,三个智能体分别审查代码、设计与事故报告,其中代码审查器四个月内标记 230,000 处违规、拦截 16,000 次合并。

  • 动态tl;dr sec

    Google PageBreak 智能体扫描器、Perplexity 智能体安全工具与智能体化防御

    Google 产品安全团队的智能体 PageBreak 自 2025 年 11 月起在 Google 一方 Web 应用中找出 500 多个 XSS 漏洞,主要使用 Gemini 3.1 Pro 和 3.5 Flash,误报近乎为零。其核心是确定性验证:每个漏洞假设都交由验证器向运行环境投递真实载荷,确认 JavaScript 执行、文件写入或外发 DNS 后才判定成立。在数百个基于 Google 高保障 Web 框架的应用中,该智能体仅发现 2 个 XSS 漏洞,均位于内部应用或加固不足的调试端点。

  • 动态Cisco

    Cisco AI Defense 与 Armada 合作:分布式 AI 在任务所需之处安全运行

    Cisco AI Defense 与 Armada 合作,为分布式 AI 提供 AI 原生安全层:通过 Adaptive Red-Teaming 在生产前对模型做红队验证,并在运行时对提示词、响应、MCP 交互和工具调用施加护栏,覆盖提示注入、越狱、敏感数据泄露、不安全内容、工具滥用等风险。该方案面向 Armada Bridge GPU 上部署的 LLM,支持云、主权云与边缘环境,敏感 AI 载荷与运行时执行保留在客户或租户环境内,策略、可见性与报告可集中管理。