跳到正文

全部动态

今天新收录 69 条

第 9 页更新的内容回到最新

10月8日周四
  1. tl;dr sec · 收录 · 原文 新闻26

    tl;dr sec #349:AI 时代的漏洞与利用、包管理器沙箱化、AI 沙箱测试(原文,在新标签页打开)

    XBOW 提出先让智能体以各角色登录并绘制权限边界,再据此判定 IDOR 结果,以降低误报;PortSwigger 为 Turbo Intruder 加入 HTTP/3 支持,Wi-Fi 下单机可发超过 10 万请求/秒,是同环境下 HTTP/1.1 的三倍以上。Aikido 在 gocommunity-io/dockerd、kreuzwenker/docker 两个 Terraform provider 及两个 Go 模块中发现 Graphalgo 恶意代码,仅在两个 Terraform 变量的 SHA256 哈希匹配硬编码值时才解密运行 Go RAT,并通过 Slack 和 Arbitrum Sepolia 上的以太坊智能合约接收加密指令,其 Slack 频道显示自 2026 年 7 月以来仅 18 台主机受感染。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. Jessica Tillipman · 收录 · 原文 新闻43

    当 AI 智能体在政府采购中实施欺诈,责任该由谁承担(原文,在新标签页打开)

    乔治华盛顿大学法学院 Jessica Tillipman 在《The Government Contractor》撰文分析,当 AI 智能体在政府采购流程中自主实施欺诈时,现有法律在明知、意图与归责上存在认定困难。文章以 2026 年 3 月陆军合同司令部在移动战术炮原型提案征集中明确禁止隐藏文本、微缩字体等操纵 AI 评估手段为例,说明采购方已开始防范提示注入。作者区分三类情形:承包商故意植入隐藏指令可依 18 USCA § 1343 电信欺诈和 § 1031 重大欺诈追责;指示智能体代为植入仍可依 § 2(b) 视为本人行为;而当承包商只给出“最大化中标概率”这类目标、由智能体自行选择不当手段时,电信欺诈所需的特定欺诈意图难以证明。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. OpenAI · 收录 · 原文 新闻26

    OpenAI DevDay 2026 回顾:GPT-6 Astra、ChatGPT、Codex 与 API 更新(原文,在新标签页打开)

    OpenAI DevDay 2026 公布 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API 以及面向开发者的安全与新工具。

    5 条报道 · 3 个来源查看事件时间线与全部报道
  4. The Decoder · 收录 · 原文 新闻26

    AI 数学突破引 Ethereum 研究者争论钱包安全崩溃速度(原文,在新标签页打开)

    Ethereum 研究者 Justin Drake 警告,AI 辅助数学进展最坏情况下可能在数月内攻破加密钱包所用的签名系统,呼吁行业准备"bunker mode",把资金转移到从未签署过交易的地址。Vitalik Buterin 在 X 回复中认同风险但反对行动过快,称自己因迁移失误损失的钱比被黑客攻击还多,并主张长期采用尽量只依赖哈希函数的架构。目前 ECDSA 签名方案在实践中尚未被真正攻破。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. The Guardian · 人工智能 · 收录 · 原文 新闻33

    One Nation 的 AI 竞选视频引发澳大利亚政治“AI 垃圾化”争论(原文,在新标签页打开)

    澳大利亚 One Nation 党在维州竞选启动活动上播放了一段 AI 生成的竞选视频,内含持砍刀男子、穿爆炸背心男子等种族刻板印象画面,媒体大多未予关注。该视频目前仅存在于网络,澳大利亚通信与媒体管理局因权限不覆盖此类内容而无法采取行动,选举委员会也只能监管选举流程相关的虚假信息。联邦工党政府迄今未回应禁止选举期使用 AI 生成内容的呼声,参议员 David Pocock 已推动两年、征集到 3.5 万人签名请愿。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  6. Anthropic · 收录 · 原文 新闻57

    Anthropic 详解如何在 claude.ai、Claude Code 与 Claude Cowork 中隔离 Claude(原文,在新标签页打开)

    Anthropic 工程团队发文介绍其三大 Agent 产品 claude.ai、Claude Code 和 Claude Cowork 的隔离架构,核心思路是在环境层设定硬边界,再在模型层引导行为。claude.ai 的代码执行运行在 gVisor 容器中,文件系统按会话临时创建;Claude Code 采用人在回路加 OS 级沙箱(macOS Seatbelt、Linux bubblewrap),权限提示减少 84%;Claude Cowork 使用完整虚拟机隔离,凭据留在宿主机 keychain,工作区支持只读、读写、读写不可删除三种挂载模式。Anthropic 称 Claude Opus 4.7 在 Gray Swan Agent Red Teaming 基准上单次提示注入攻击成功率约 0.1%,100 次自适应尝试后约 5–6%。

    推荐理由Anthropic 公开三款 Agent 产品的隔离架构与真实失败案例,为设计 Agent 沙箱和出口控制的团队提供可迁移经验。

  7. Cloud Security Alliance(AI 相关) · 收录 · 原文 新闻17

    如何在遗留业务应用中构建生成式 AI 层(原文,在新标签页打开)

    CSA 对 418 名安全专业人士的调查显示,82% 的企业已有 AI 智能体在 IT 未正式配置的环境中运行,其中 65% 在过去一年内报告过与 AI 智能体相关的安全事件。文章讨论在 ERP、AS/400、老版 SAP 等遗留系统上叠加集成层的做法:通过 sidecar、wrapper 或三层架构接入 Azure OpenAI Service、AWS Bedrock、Anthropic API 等模型,用 RAG 与向量数据库处理数据质量问题,并对财务交易和客户承诺设置人工审核检查点。

  8. Scale AI Research Blog · 收录 · 原文 日期未知新闻47

    Scale AI 发布企业 AI 红队实测:自动评测违规率 3%,真人测试达 68%(原文,在新标签页打开)

    Scale AI 公布其企业 AI 红队方法与实践数据,指出只测模型会漏掉系统层风险。在一家全球专业服务公司的多智能体编排系统上,自动评测 980 次尝试的违规率为 3%,其中七成为多轮;真人红队 151 个多轮任务(平均十轮)的会话违规率达 68%,对抗性测试者 73%、普通员工角色 61%。经四轮测试与修复,违规率降至 20% 再到 14%,攻破所需轮次中位数从七轮升至十六轮。在消费房贷短信助手上,161 段多轮对话中 115 段违规、24 段严重,涉及 16 类危害中的 14 类,包括公平借贷、否认自己是 AI 并给出真人银行员姓名;该机构已在助手前置独立防护模型并重构架构。Scale AI 提出企业系统需测试提示词、上下文、工具、智能体与规则五层,先与客户共同编写危害分类表,再按自动化基线、真人测试、按系统评分、补丁后复测的循环推进。

    推荐理由Scale AI 用两起企业部署案例给出自动评测与真人红队的差距数据,以及五层系统测试与危害分类表的落地流程。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  9. Advisory Group on Mathematics and Artificial Intelligence · 收录 · 原文 新闻46

    数学与 AI 顾问组就 OpenAI 发布数学成果发表意见并重申发布准则(原文,在新标签页打开)

    数学与人工智能顾问组(AGMAI)就 OpenAI 发布由内部模型生成的大批数学成果发表意见,称 OpenAI 报告了数百个开放问题的解答,并认为这是数学界的重要事件,其影响远超单个结果本身。该顾问组由 François Charles、Timothy Gowers、Martin Hairer、Edward Witten 等数学家组成,在 OpenAI 接触部分成员提议设立外部顾问委员会后,改为独立组建,不接受任何 AI 公司报酬,也不具备决策权。顾问组此前于 9 月 29 日发布 AI 生成数学成果负责任发布的一般准则,参考了六百多份问卷回复;10 月 6 日的意见重申这些准则,表示已与 OpenAI 讨论并认可其沟通意愿,但强调评估准则落实程度仍应由数学界完成。

  10. Financial Times · 人工智能 · 收录 · 原文 新闻20

    AI 时代的网络战将如何改变(原文,在新标签页打开)

    AI 智能体已开始被用于网络攻击:澳大利亚政府披露 AI 智能体入侵其医疗系统,Anthropic 报告称俄罗斯网络行为体正用 AI 更低成本地实施侦察、入侵与数据窃取。这些攻击尚未完全自主,但将控制权交给机器会让防御方难以判断攻击意图与责任归属,攻击方也面临 AI 自行决定行为方式带来的失控风险。文章认为,威慑需要针对这种"以控制权换取能力"的权衡。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  11. 论文追踪 · 收录 · 原文 论文58

    研究者提出视觉中心越狱攻击 VJA,Nano Banana Pro 攻击成功率达 80.9%(原文,在新标签页打开)

    清华大学与鹏城实验室等机构的研究者提出纯视觉越狱攻击 VJA,把有害编辑指令编码进图像。

    推荐理由论文给出视觉提示越狱在多个商业图像编辑模型上的成功率,并配套基准与免训练防御,便于评估图像编辑链路的安全缺口。