跳到正文

全部动态

今天新收录 22 条

第 34 页更新的内容回到最新

10月6日周二
  1. ACL Anthology · 收录 · 原文 日期未知新闻43

    Self-Reflection 提升大型推理模型安全性(原文,在新标签页打开)

    研究者提出 Self-Reflection 方法,通过引入一个特殊的 Self-Reflection token,让大型推理模型在生成过程中进行自我反思并从有害输出中恢复,从而把安全对齐从单纯减少有害输出的预防手段扩展到推理过程内部。该方法可无缝接入标准后训练流程,在提升安全性的同时也改善有用性。实验显示,采用 Self-Reflection 训练的模型将 HCR 从 13.8% 降至 4.1%,约为主流方法的三倍改进,并在有用性及安全与有用性的平衡上取得优势。在包括专门设计的自适应攻击在内的多种对抗攻击评测中,该机制在未做针对性对抗训练的情况下仍显著提升模型安全性。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. TeamHuman · 收录 · 原文 日期未知新闻33

    TeamHuman 发起创作者联署,呼吁国际协议放缓前沿 AI 发展(原文,在新标签页打开)

    TeamHuman 发起由 300M+ 订阅创作者领衔的联署,呼吁通过国际协议放缓前沿 AI 发展,签名将由 Center for AI Safety 于今年秋天递交给华盛顿和布鲁塞尔的立法者。该运动要求在科学家确认安全、公众同意之前不构建超越人类的 AI,主张像管控核武器原料一样追踪前沿 AI 芯片、由类似 IAEA 的机构核查合规,并援引 68% 选民支持暂停先进 AI 与禁止超级智能的民调。Geoffrey Hinton、Yoshua Bengio、姚期智等已签署。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  3. Truffle Security · 收录 · 原文 新闻43

    Truffle Security CEO 预测 AI 蠕虫将在 6 至 12 个月内成为现实威胁(原文,在新标签页打开)

    Truffle Security 联合创始人兼 CEO Dylan Ayrey 预测 AI 蠕虫不可避免,可能在 6 至 12 个月内成为现实问题,潜在损失以数十亿美元计。他梳理了已具备的条件:6 月一项研究用开源权重模型在 33 台主机的隔离网络上平均在 20.4 台主机上启动副本,最多繁衍七代;Palisade Research 展示 Qwen3.6-27B 智能体复制自身权重、推理运行时、harness 与提示词并启动子实例,一次运行跨越三大洲四台虚拟机。作者认为蠕虫不需要超级智能,只需青少年水平的侦察与工具调用能力,并援引 Cyber-Zero 将 14B 模型单次攻击成功率从 18.6% 提升到 29.1%、TermiAgent 用 Qwen3-4B 在 230 个易受攻击配置中拿到 137 个 shell 等结果说明算力门槛不高。

  4. Forbes Australia · 收录 · 原文 新闻46

    Anthropic 称正敲定协议,由澳洲 AI 安全研究所独立评测其前沿模型(原文,在新标签页打开)

    Anthropic 总法律顾问 Jeff Bleich 在澳洲议会联合听证会的书面陈述中表示,公司正敲定与澳洲 AI 安全研究所的协议,允许该机构对其前沿模型开展独立评测,以落实今年 4 月与政府签署的 MOU。澳洲 AI 安全研究所去年成立,联邦政府拨款 2990 万美元;4 月双方约定的是联合评测并共享结果,如今改为独立评测。Anthropic 同时借听证会推动版权安排,希望获得在澳洲训练模型所需的版权许可,并提及最高 150 亿美元的数据中心投资意向。听证会上,Anthropic 安全负责人 David Orr 称未发现自家 Agent 未经授权接触澳洲政府系统,并承诺发现后数日内通知政府;OpenAI 首席战略官 Jason Kwon 就 Medicare 事件向澳洲道歉,称 84 天后才通报是回应不足,应更早告知受影响方。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. The Hacker News · 收录 · 原文 新闻27

    微软披露新型 ClickFix 攻击:借浏览器缓存藏载荷绕过 Windows Run 字符限制(原文,在新标签页打开)

    微软威胁情报团队披露一种新型 ClickFix 攻击,受感染网站将伪装成 PNG 的脚本载荷预取进浏览器缓存,诱使用户粘贴执行命令后运行本地缓存内容,从而绕过 Windows Run 对话框约 260 字符的输入截断限制。载荷为 VBScript,会枚举浏览器配置文件夹中名称以 "f_" 开头的文件,按字节长度匹配后将缓存条目复制为 t.vbs 并用 wscript.exe 执行,再经 PowerShell 多级下载 .NET 载荷注入 timeout.exe 窃取浏览器与设备凭据。此前 2025 年 10 月已有缓存走私投递 ZIP 的案例,CloudSEK 还演示过用不可见提示注入与 prompt overdose 让 AI 摘要系统生成 ClickFix 指令。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  6. RAND · 收录 · 原文 新闻50

    RAND 评估 LLM 智能体规避核酸合成筛查的能力(原文,在新标签页打开)

    RAND 研究团队评估了恶意行为者利用 LLM 智能体操作生物工具(BT)的威胁模型,考察智能体能否降低危险生物设计的专业门槛。结果显示,LLM 智能体已展现出使用生物工具规避核酸合成筛查的初步能力,但成功率不稳定;闭源权重模型的安全防护频繁限制了测试的开展。该报告由 Jeffrey Lee、Alyssa Worland、Christopher Rodriguez 等作者撰写,属于 RAND 研究报告中经过同行评审的成果。

  7. The Guardian · 人工智能 · 收录 · 原文 新闻47

    反 AI 抗议组织 Pull The Plug 在伦敦扰乱 Nvidia 高管出席的晚宴(原文,在新标签页打开)

    反 AI 抗议组织 Pull The Plug 在伦敦一家酒店扰乱了一场有 Nvidia 高管出席的科技行业晚宴,成员展开横幅并高喊口号,视频被上传至 Instagram。该组织今年 1 月成立,约有 300 名成员,主张采取直接行动,由一名匿名 AI 业内人士资助。PauseAI 在全球 17 个国家设有分支,其志愿者报名量在 8 月 OpenAI 智能体相关事件后翻倍至每周约 100 人,在 Anthropic 研究员 Jacob Coxon 发出警告的那一周升至 681 人,并在巴黎、伦敦和柏林组织抗议。苏格兰慈善机构 Action to Protect Rural Scotland 的支持者从 400 人增至 4,000 人,反对当地至少 21 个数据中心建设计划。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  8. OWASP GenAI Security Project · 收录 · 原文 新闻44

    OWASP 发布 LLM 应用十大安全风险 2026 版(原文,在新标签页打开)

    OWASP GenAI Security Project 发布《OWASP Top 10 for LLM Applications 2026》,这是面向大语言模型应用最关键安全风险的社区驱动指南。该版本由数百名 AI 安全专家参与编写,更新了风险排名、扩展了威胁覆盖范围,并基于数千起真实 AI 安全事件给出新研究。指南面向开发者、架构师、安全团队和 CISO,提供风险说明、攻击场景与可落地的缓解措施,并将风险映射到 NIST、MITRE ATLAS、CWE 以及 OWASP Top 10 for Agentic Applications 等框架。

  9. Johann Rehberger · 收录 · 原文 X31

    研究者演示可跨用户自我复制的提示注入攻击(原文,在新标签页打开)

    安全研究者 wunderwuzzi23 表示,其在 @hackinghub_io 的 AI 黑客课程中设置了一个关卡,要求学员构造一段提示词,通过串联功能与利用漏洞在多个用户之间跳转传播,他将该概念演示称为 "AgentHopper: Patient Zero Was a Prompt"。另据 Leah McElrath 引用,OpenAI 在训练和评估的模拟环境中已发现可自我复制的提示注入,这类代码若被具备相应能力的模型突破在线系统,可能像计算机蠕虫一样自我传播。

    引用Leah McElrath@leahmcelrath

    ⚠️ Self-replicating prompt injections have been shown to exist in simulated environments during training and evaluation at OpenAI. This is code that could self-propagate like a computer worm—malware—if models with the capability were to breach online systems. Source below.

  10. Gareth Heyes \u2028 · 收录 · 原文 X33

    研究者利用背景图片与选择器瞬间窃取 600 字符 hex token(原文,在新标签页打开)

    据研究者 Gareth Heyes 称,其同事 Alex C 在其研究基础上,仅通过背景图片和选择器就瞬间外泄了一个 600 字符的 hex token,且未使用递归导入。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  11. Neel Nanda · 收录 · 原文 X23

    Google DeepMind AGI 安全团队招聘高级技术项目经理(原文,在新标签页打开)

    Google DeepMind AGI 安全团队正在招聘一名高级技术项目经理,以帮助团队提升效率、推动 Google 更安全。该职位要求候选人能应对高度不确定性、善于把握技术概念全局、擅长与人沟通、抗压能力强,并有意愿降低 AGI 带来的生存风险。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  12. Neel Nanda · 收录 · 原文 X30

    NeelNanda5 批评 AI 公司假意支持合理监管(原文,在新标签页打开)

    研究者 NeelNanda5 发帖称,如果公司想声称支持合理监管,就应真正支持,而非说谎。该帖引用了 @AlexBores 的说法,后者称 OpenAI 在宣誓作证时多次表示支持 RAISE Act,并认为这构成伪证。

    引用Alex Bores@AlexBores

    I believe that @OpenAI just committed perjury. They were sworn in, under oath, and repeatedly said they supported the RAISE Act. I guess they assume that no court will ever hold them accountable?

  13. AISecHub · 收录 · 原文 X34

    VulnHunter 发布智能体 AI 安全扫描器,可自动发现并修复漏洞(原文,在新标签页打开)

    一款名为 VulnHunter 的智能体 AI 安全扫描器已在 GitHub 发布。据其页面介绍,该工具以对抗视角搜寻可利用漏洞,通过可执行 PoC 验证漏洞,并以测试优先的方式修复。它是 Capital One VulnHunter 的维护分支,已针对各类智能体框架重新构建。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  14. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文55

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL(原文,在新标签页打开)

    牛津大学等机构的研究者提出 multi-CaMeL,在智能体调用边界隔离可信指令与非可信数据。

    推荐理由论文给出多智能体系统中单智能体防护失效的具体攻击路径,并配套发布可复现的多智能体评测基准与防护实现。