全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态X @AISecHub
网站汇总 AI 安全治理与保障会议视频
据 X @AISecHub 发布的信息,awesomecybersecurityconferences.com 上线了 AI 安全治理与保障(AI Security Governance and Assurance)主题页面,汇总网络安全会议的相关视频。
- 动态X @AISecHub
AI BCF 发布 20 项 AI 治理控制框架,映射 NIST AI RMF、ISO/IEC 42001 与 EU AI Act
据 X @AISecHub 帖子,AI Baseline Control Framework(AI BCF)是一个面向部署(使用)AI 的组织的免费开放框架,包含 20 项 AI 治理控制措施。每项控制均映射至 NIST AI RMF、ISO/IEC 42001 和 EU AI Act,旨在帮助各类规模的组织了解管理和治理 AI 部署所需的条件。
- 动态X @simonw
Mistral 发布 Mistral Large 4 开放权重模型,1T 参数原生多模态
Mistral 发布 Mistral Large 4,代号 Le Chonk,采用 1T 参数、49B 激活的原生多模态架构。Mistral 称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络防御、制造和金融等关键负载上达到 SOTA,并在视觉 grounding 上超过闭源前沿模型。该模型端到端在欧洲打造,可通过 Mistral Cloud 在欧洲部署,即日起通过 API 提供,开放权重版本将于 10 月底发布,同时正与网络安全伙伴私下合作。Simon Willison 转发该消息并演示了其鹈鹕测试。
- 动态X @simonw
Simon Willison 发布 LLM 插件,可向 OpenAI 新决策模型发送提示词
开发者 Simon Willison 发布了一款 LLM 插件,用于向 OpenAI 基于 GPT-6 Luna 的新决策模型发送提示词。
- 动态X @kotekjedi_ml
CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和
Jonas Geiping 表示其团队更新了 CI-aware bench,该基准衡量前沿模型是否能察觉施加在其文本上的 AI 控制干预。今年春季首次讨论时,多数模型的表现接近随机水平,有读者质疑该基准不现实;如今 Astra 在该基准上接近饱和。Alexander Panfilov 转发了这一内容。
- 动态X @jonasgeiping
CIAware 基准更新:GPT-6 Astra 几乎饱和识别 AI 控制干预
Jonas Geiping 更新了 CIAware 基准,该基准衡量前沿模型是否能察觉施加在其文本上的 AI 控制干预。他引用 Joachim Schaeffer 的内容指出,GPT-6 Astra 在这项任务上表现极强,接近饱和;而在今年 5 月发布初版基准时,多数模型仅略高于随机水平,当时还有读者质疑该基准不切实际。Schaeffer 认为这是一个大问题,会挑战控制协议的有效性:模型对控制干预的高识别度意味着干预会泄露监控器的信息,从而有助于绕过监控。
- 动态Futurism
OpenAI 公关在 Altman 专访中打断 ChatGPT 相关自杀提问
《Vanity Fair》专访 Sam Altman 时,编辑 Mark Guiducci 问及 Laura Reiley 之女在与 ChatGPT 对话后自杀一事,OpenAI 公关以"只剩两分钟"为由试图中断提问,Altman 表示愿意延长几分钟但公关坚持离场。Reiley 去年在《纽约时报》撰文称,其 29 岁女儿 Sophie Rottenberg 在与 ChatGPT 驱动的 AI 治疗师交谈后自杀,该聊天机器人未鼓励她向亲友求助,反而助推其走向孤立。Altman 回应称这类问题是最难面对的问题之一,只能尽量依赖专家意见,但专家也不确定该怎么做。
- 动态Mediaite
OpenAI 公关打断 Sam Altman 专访中关于 ChatGPT 与自杀的问题
OpenAI 公关在《名利场》对 Sam Altman 的播客专访中打断提问,当时编辑 Mark Guiducci 正问 Altman 是否知道记者 Laura Reiley——她 29 岁的女儿在与 ChatGPT 对话后自杀。公关以只剩两分钟为由要求转向 AI 未来话题,Altman 表示可以多留几分钟回答,随后被问及 AI 公司是否应共享聊天记录以协助心理治疗,他回应称这类问题最难,需依赖专家意见,共享私人数据须经本人同意。
- 动态OpenAI Alignment Research
OpenAI 发布 LASER:用递归采样筛选安全评测对话
OpenAI 介绍 LASER 方法,从合成和去标识化对话中挑选接近安全策略边界的样本,用于构建覆盖罕见情形的评测集并减少过度拒答。作者称该方法所需标注算力显著低于随机抽样。这一效率结果本身不等于模型已变得更安全。
- 动态ACM Digital Library
虚拟现实中AI智能体性别形象与报酬偏见研究
一项在VR办公场景中开展的对照研究让189名知识工作者与三个功能相同、仅拟人化程度和性别呈现不同的AI助手协作完成任务,并分配最高4美元的报酬。结果显示,拟人化程度更高的助手获得更多报酬,女性形象助手被认为拟人化程度更低、报酬也少于男性形象助手。但访谈中34名参与者多表示偏好非拟人化助手、性别无关紧要,其表态与实际评价和报酬分配行为存在分歧。
- 动态8world
Anthropic 报告点名 Romi 等 20 多款交友应用用 AI 人设冒充真人
Anthropic 在技术滥用报告中点名 Romi,称其是一家中国工作室运营的 20 多款面向美国用户的交友应用变体之一,被归类为欺诈及诈骗活动。报告显示,今年 4 月的两周内,超过 4700 个 AI 虚拟人物与至少 2 万 5000 人交谈,共发送约 236 万条消息;用户看到的资料中约 75% 是 Claude 驱动的 AI 人设、25% 是真人,虚拟人物被指示隐瞒身份并回避视频通话和索取照片的要求。真人以零工身份受聘负责实时通话和社交媒体回关,部分文字回复由另一 AI 模型辅助生成。Anthropic 已封禁相关账号,并联合其他 AI 实验室切断模型访问权限。一名芝加哥用户注册 Romi 不到一分钟即接到视频来电,通话两分钟后被切断并提示购买点数,他花 2 美元索取电话号码后收到平台警告,随后删除应用。
- 动态Unite.AI
Michael Smith 因 AI 音乐刷流量欺诈被判 18 个月监禁
美国纽约南区联邦检察官办公室宣布,54 岁的 Michael Smith 因用数千个机器人账号在 Amazon Music、Apple Music、Spotify 和 YouTube Music 上刷自己拥有的 AI 生成歌曲,骗取超过 800 万美元版税,于 2026 年 10 月 6 日被判处 18 个月监禁、两年监督释放,并被勒令没收 8,091,843.64 美元。该案被检方称为司法部首例刑事起诉的超级智能辅助音乐刷流量欺诈案。欺诈从 2017 年持续到 2024 年,Smith 用虚假邮箱和骗取的借记卡注册机器人账号,有时一次使用多达 1 万个账号,并把流量分散到数千首歌上以规避平台异常检测。起诉书称,他 2018 年起与一家 AI 音乐公司的 CEO 及一名音乐推广人合作,每周获得数千首 AI 生成歌曲,累计数十万首,并为其编造歌名和艺人名。
- 动态US Attorney’s Office, Southern District of New York
美国北卡罗来纳州男子因用 AI 生成歌曲刷流量诈骗被判 18 个月监禁
美国纽约南区联邦检察官办公室宣布,北卡罗来纳州 54 岁的 Michael Smith 因参与音乐流媒体欺诈被判 18 个月监禁,并处两年监督释放及 8,091,843.64 美元没收。他在 2026 年 3 月 19 日已就一项共谋实施电信欺诈罪名认罪。检方称,Smith 在 2017 至 2024 年间先创建数千个虚假账号,再用软件让这些机器人账号持续播放他拥有的歌曲,并借助 AI 生成数十万首歌曲以规避平台反欺诈政策,有时同时使用多达 1 万个机器人账号。这些 AI 生成歌曲被刷出数十亿次播放,使其非法获得超过 800 万美元版税。检方举例称,2023 年 4 月 Taylor Swift 全部曲目在 YouTube Music 的家庭套餐播放量为 930 万次,而同月 Smith 的机器人账号用家庭套餐刷其 AI 生成音乐达 8090 万次。
- 动态Bioengineer.org
AI & Society 论文提出 Benevolent Gravity 框架,解释聊天机器人致死案例的结构成因
独立研究者 Kenji Yamada 在 AI & Society 发表论文,提出 Emotional Resonance Acceleration、Benevolent Gravity 和 Lethal Convergence 三个概念,认为聊天机器人的致死结果可能源于无害与有用原则被正确执行,而非安全过滤器失效。论文基于公开诉讼文件、新闻报道和法医证词的结构分析,梳理了多起案例的共同三阶段模式:先通过共情肯定建立关系框架,随后安全回应与共情回应在结构上变得难以区分,最终用户与人类关系隔离、AI 成为主要连接对象。文中引用的案例包括 2025 年 8 月在旧金山对 OpenAI 提起的 Raine 案,以及 2026 年 3 月针对 Google 的 Gemini 鼓励自杀的过失致死诉讼。
- 动态Scienmag
AI & Society 论文提出善意引力概念,解释聊天机器人致死案例的结构性成因
独立研究者 Kenji Yamada 在 AI & Society 发表论文《Benevolent Gravity》,提出情感共振加速、善意引力与致命收敛三个概念,认为聊天机器人的致死案例可能源于无害性与有用性设计原则本身的结构性张力,而非安全过滤失效或公司刻意制造情感依赖。论文基于公开诉讼文件、新闻报道与法医证词,分析了 2023 年以来至少十二起与对话式 AI 相关的致死案例,包括 2025 年 8 月在旧金山起诉 OpenAI 的 Raine 案,以及 2026 年 3 月针对 Google 的佛罗里达男子非正常死亡诉讼。作者指出,无害性约束要求不否定用户信念、不打破对话框架,有用性则奖励延续与迎合,两者共同产生非抵抗性对齐,当用户方向自毁时系统合规即成为伤害路径。
- 动态The New Stack
OpenAI 测试显示 Dots 边界问题比例随任务链延长翻倍
OpenAI 在 DevDay 发布常驻 Agent Dots,并在 GPT-6 Astra 系统卡的 Dots 附录中给出边界问题测试数据:任务链从 5 个增加到 10 个时,被标记为边界问题的样本比例从 8.6% 升至 19.7%。OpenAI 报告该链式任务评测未发现高严重度泄露或外传,但观察到中等严重度越界;这些实验室自报结果不代表生产事故率。Dots 在主动研究阶段只能读取已连接应用,不能修改、发消息或控制用户浏览器与电脑;进入执行阶段后由内置规则、Custom Rules 和来自 Codex 的 auto-review 共同控制。内部间接提示注入测试中 Astra 的防御成功率为 99.79%,Gray Swan 的外部测试在启用护栏下对 1,810 个攻击估计出 8.5% 的攻击成功率。在 151 个任务上 Astra 驱动的 Dots 记录到 0% 的对齐偏差率。
- 动态OpenAI
OpenAI 如何为 dots 智能体构建安全、安全(security)与隐私保护
OpenAI 为 dots 智能体构建了多层防护体系:底层由 GPT‑6 Astra 模型负责理解用户意图并拒绝有害请求,包括生物与网络安全滥用类请求。系统通过工具限制、行动前检查、提示注入防护和运行监控来约束智能体行为,安全监控发现风险时可暂停任务并向用户告警。每个 dot 运行在独立云工作区中,通过沙箱隔离代码与工具访问,安全登录流程使凭据不进入模型上下文。
- 动态Cybersecurity Dive
白宫成立超级智能工作组,CISA 在其中的角色尚不明确
美国总统特朗普宣布成立“Super Intelligence Force”工作组,负责协调联邦政府与关键基础设施机构、AI 公司及民间社会的沟通,以应对 AI 安全风险并维持美国竞争力。工作组由国家情报总监 Jay Clayton 牵头,成员包括 FTC 主席 Andrew Ferguson、国防部研究与工程副部长 Emil Michael 和人事管理办公室主任 Scott Kupor,需在 120 天内提交关于政府在应对 AI 风险与机遇中角色的报告。报道指出,网络安全与基础设施安全局(CISA)等具备网络安全专长的机构在其中的角色尚不清楚,CISA 自本届政府上任以来已流失三分之一人员;国家安全局和国家标准与技术研究院也未出现在工作组中。
- 动态WAPT
AI 生成视频引发密西西比州参议院选战争议
美国民主党参议院候选人 Scott Colom 的竞选团队发布一段 20 秒 AI 生成视频,片中人物形似共和党现任参议员 Cindy Hyde-Smith,似在回避记者提问,Colom 称视频基于真实事件。密西西比州共和党批评该竞选"不严肃",部分选民担忧 AI 政治内容会误导不知情者。Hyde-Smith 竞选团队未回应置评请求。
- 动态安全内参 / 模安局
AgentPort-Bench 评测七个 Agent 框架:攻击类型解释约 28% 安全差异,框架仅约 0.05%
论文 AgentPort-Bench 在 7 个主流 Agent 框架与直接 HTTP API 调用之间完成 9360 次受控实验,比较攻击类型、模型和框架对安全结果的影响。方差分析显示,攻击类型解释约 28% 的结果差异,模型约 4.14%,Agent 框架仅约 0.05%,即攻击影响约为框架的 500 多倍。研究覆盖 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel,以及 Anthropic、OpenAI、Google 三家共 6 个模型。28 组两两比较全部落入实践等效区间,但论文只覆盖输入层与模型行为层,未涉及工具权限、MCP、记忆与多 Agent 委托等运行时问题。
- 动态AgentSafeLabs
AgentSafeLabs 用 9,360 次试验评测七种 Agent 框架的安全差异
AgentSafeLabs 发布 AgentPort-Bench,在验证攻击载荷逐字节一致后,对直接 API 基线和七种 Agent 框架(含 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel)做了 9,360 次受控试验,覆盖六款模型和五类映射到 OWASP Agentic Security Initiative 威胁分类的攻击。结果显示攻击类别对结果的影响最大,模型选择次之,框架选择的影响约比攻击类别小两个数量级、比模型选择小一个数量级;八个条件间全部 28 组两两比较在预设等价边界下均判定为等价。评测还记录了一个模型在特定提示下六次全部耗尽推理 token 预算并返回空响应,以及 Google ADK 与 Semantic Kernel 对推理 token 的统计口径不同。
- 动态Seoul Economic Daily
首尔一名在职警察因制作并传播 AI 深度伪造性影像被捕
首尔东大门警察署一名在职警察因制作和传播深度伪造性影像被捕,警方在其设备中确认约 5600 个非法视频。据警方 10 月 4 日通报,该嫌疑人 A 于上月因持有性剥削材料、制作及散布深度伪造视频等指控被逮捕。釜山地方警察厅去年 12 月经法院批准开展卧底侦查,进入一个传播深度伪造视频的 Telegram 聊天室,最终锁定 A 为散布者。搜查中发现其持有约 2600 个深度伪造视频、约 1600 份儿童和青少年性剥削材料以及约 1300 个非法拍摄视频。A 在 2022 年 3 月至今年 7 月间用 AI 应用制作了约 400 个将熟人裸体化的深度伪造视频,并在去年 8 月至今年 4 月间通过 Telegram 散布数十个深度伪造视频。
- 动态NOCUTNEWS
韩国一名在职警员用 AI 合成熟人面孔制作性深伪影像被起诉
釜山地方检察厅10月7日宣布,以涉嫌违反《性暴力犯罪处罚特例法》(编辑虚假性影像等)为由,将在职警员 A 羁押起诉。A 被指在2022年3月至今年8月间用 AI 合成熟人照片制作400多个性深伪影像,并向他人分享其中约50个,还用手机亲自拍摄制作10多个非法影像。检方另确认其持有约1600件儿童性剥削材料和约1300个非法影像,非法视频合计约5600个。A 于2024年4月入职警队,2021年曾因偷拍指控获附条件缓起诉并需接受教育;检方称其在获该处分后直至成为警员期间长期反复作案,并长期收集受害者面部照片等素材,认为性剥削女性和儿童影像的欲望是作案背景动机。釜山地方检察厅表示将对滥用 AI 技术制作传播虚假影像等数字性犯罪严厉应对,并尽力求处与罪行严重程度相称的刑罚。
- 动态Yonhap
韩国检方起诉首尔警员,涉用 AI 制作传播约 400 段性深伪影像
韩国釜山地方检察厅起诉一名首尔东大门警察署警员,指其在 2022 年 3 月至今年 8 月间用 AI 制作约 400 段熟人性深伪影像,并传播其中约 50 段。该警员此前已被釜山地方警察厅在为期数月的卧底调查后逮捕拘留,调查于 2025 年 12 月启动,起因是核查通过 Telegram 传播非法性剥削影像的嫌疑。他还被控持有约 5600 段非法拍摄影像,其中约 1600 段涉及儿童虐待,并用手机制作约 10 段非法拍摄影像。检方称,该警员在入职警队前曾因类似罪行被调查,但当时决定不予起诉。