跳到正文

观点与讨论

研究者与从业者的观点、辩论与研究议程。

627条动态与论文相关主题政策与监管对齐前沿安全框架
在这个话题内搜索或按分类筛选

新闻与论文

第 361–380 条 · 共 627 条
10月1日周四
  1. arXiv · 收录 · 原文 论文43

    人类对齐的模型是人类行为的模型吗?偏好对齐中的图灵测试差距

    论文区分了与人类偏好对齐和与人类行为对齐,指出人们偏好的 AI 回复未必是他们自己会给出的回复,并将此称为图灵测试差距。作者证明偏好对齐仅在一种严格条件下才能保持人类回复分布,且未发现真实人类偏好满足该条件的一致证据。实验显示,人类回复似然度的损失随偏好加权强度增加而增大,与加权方向无关,该差距在标准 DPO 下同样出现。研究据此提出,人类相似性应作为对齐的一个显式维度,而非假定其会随偏好对齐自然产生。

  2. arXiv · 收录 · 原文 论文27

    Atria Dawn Preview:智能体超级智能的黎明

    研究团队发布面向科研与工程工作流的基础智能体语言模型 Atria Dawn Preview,通过可验证经验管线将工具交互连接到可执行环境与外部验证结果。该模型在覆盖真实科研、工程与数字工作的 16 项基准中与前沿智能体相当,并在其中 5 项取得已报告最高分。基于 56 名参与者、769 条任务记录的分析显示,约三分之一 AI 辅助完成的任务被参与者评为无 AI 则不可行,智能体常提出方法并实施修改,但最终决策仍由人类保留。

  3. arXiv:危险能力与安全评测 · 收录 · 原文 论文29

    当合规数据伪装成评测:部署后 AI 系统的测量效度问题

    论文指出,为运营监控或监管合规收集的数据被当作对比评测证据,是部署后 AI 系统评测中的一类反复出现的失效。以自动驾驶为例,美国脱离接管与碰撞上报机制产生的运营证据,因上报范围、暴露量、部署域、事件捕获和对照构建的差异,无法单独支撑安全性对比结论。作者将其界定为 AI 评测中的测量效度问题,并提出"评测契约",要求在把运营数据解读为对比性能证据前,先明确预期能力、测量结果、暴露机会、部署域、数据生成过程与评测对照之间的对齐关系。

  4. arXiv:危险能力与安全评测 · 收录 · 原文 论文15

    防技能退化设计:元认知反馈减少对 LLM 助手的认知卸载

    一项预注册在线实验(N=704,2×2 设计加无 AI 对照组)发现,元认知反馈能减少用户向 LLM 助手卸载答案的行为(OR=0.47),并提升随后无辅助测试的成绩(OR=1.51)。实验任务是借助仅在明确请求时才给出解答的 LLM 助手练习分数运算,之后进行无辅助测试。基于努力的奖励对卸载行为和测试成绩均未产生可检测影响。

  5. 雷峰网安全频道 · 收录 · 原文 6

    安恒信息范渊:AI+安全不是从0开始

    安恒信息董事长范渊在2023西湖论剑·数字安全大会上表示,ChatGPT证明AI应用于安全领域这条路可以走通,而安恒做“AI+安全”并非从0开始。他指出AI大模型本身带来新的网络安全风险,类ChatGPT技术可使自动化生成网络攻击工具和病毒木马的效率提升几百倍,同时“AI+安全大脑”已在产品、平台和服务三个维度加速投入。安恒利用自然语言模型通过迁移学习做数据分类分级,新行业效率提升5倍以上,已积累行业提升10倍到20倍以上。

  6. 雷峰网安全频道 · 收录 · 原文 6

    知道创宇赵伟8年前提出“GPT”概念:从APT到AI+大数据驱动的实战防御

    知道创宇创始人赵伟早在2015年就提出网络安全领域的“GPT”概念,主张以超级大数据和AI技术支撑更高维度的全局攻防视角。他将网安行业划分为手动分析、自动分析、信息、智能四个时代,并推动知道创宇以“安全产生数据、数据驱动安全”的闭环构建云防御、云监测、云测绘等产品体系。他认为AI已进入“智能时代”,未来攻防趋势是“用云攻击云、用云防御云”。

  7. 雷峰网安全频道 · 收录 · 原文 6

    对话安恒刘思宇:做数字资产的守门人

    安恒信息副总裁、终端安全负责人刘思宇在2023西湖论剑·数字安全大会上表示,终端安全将朝体系化、一体化方向发展,安恒以EDR切入市场,通过无极架构实现单一客户端按需组合安全能力。据赛迪顾问《中国终端安全检测与响应产品市场研究报告(2022)》,安恒EDR占全国市场份额5%、排名第三。安恒还推出勒索行为检测引擎与智能备份引擎,前者可识别已知和未知勒索病毒,后者基于AI机器学习和内核级技术备份关键数据,两项技术已完成储备、即将推向市场。

  8. 雷峰网安全频道 · 收录 · 原文 6

    AGI 大时代,企业安全为什么需要“新进化”?

    面对 AGI 时代攻击面扩大与生成式人工智能被用于编写攻击脚本、恶意软件和钓鱼邮件,雷峰网提出企业安全需从单点防御转向“数字安全免疫力”。腾讯安全与 IDC 于 6 月 13 日“数字安全免疫力研讨论坛”联合发布数据安全免疫力模型及《加强数字安全免疫力,促进数字化时代下的韧性发展》白皮书,强调前置投入、动态轻量实时响应,把安全融入战略、管理与运营流程。

  9. 雷峰网安全频道 · 收录 · 原文 8

    对话奇安信齐向东:数智时代,老方法解决不了新难题

    奇安信董事长齐向东在 BCS2023 北京网络安全大会上表示,数智时代老办法解不了数据安全新难题,须以"内生安全"应对。他称数据正从"死"变"活"、从虚变实、从贱变贵,带来行为真假难辨、"三员"违规难控、软件供应链漏洞后门难防三大难题,82% 的数据泄露与内部有关。他认为 ChatGPT 是双刃剑,奇安信将在可直接交付时发布自研大模型。

  10. 雷峰网安全频道 · 收录 · 原文 2

    ISC 2023:360 智脑支持的 AI 数字人如何成为大模型入口

    ISC 2023 第十一届互联网安全大会以"安全即服务,开启人工智能时代数字安全新范式"为主题,打造全球首场 AI 数字安全峰会,开幕式由 360 智脑驱动的数字主持人"可心"全程主持。大会还开设线上数字小镇,50 位企业家、学者与技术专家以 AI 数字人身份围绕漏洞检测、威胁流量检测、数据安全等话题展开 50 余场演讲。周鸿祎称 AI 数字人是大模型最重要的应用入口,360 将借此降低 prompt 使用门槛,推动大模型在消费级与企业级场景落地。

  11. 雷峰网安全频道 · 收录 · 原文 13

    安全大模型层出不穷:安恒、360、奇安信等网安厂商也忍不住了

    安恒信息、360、奇安信等多家安全厂商相继发布安全大模型,网络安全行业加速拥抱GPT。安恒恒脑·安全垂域大模型已用于成都大运会及杭州亚运会,安全运营成效提升70%以上;奇安信推出Q-GPT安全机器人,360则以安全大模型打造智能中枢系统。但多位

  12. 雷峰网安全频道 · 收录 · 原文 14

    亚信安全发布安全大模型信立方,用AI对抗AI攻击

    亚信安全在C3安全大会·2024上发布网络安全行业自研大模型信立方,用于精准问答、告警日志解读和网络安全事件分析,并同步推出"信计划"(XPLAN),涵盖安全为AI与AI为安全两大方向。亚信安全高级副总裁陈奋透露,针对大模型的攻击手段一年内已涌现数十种,其团队在Llama2环境模拟海绵样本攻击,使模型响应从几秒延迟至60秒以上、慢了20倍以上。信计划已落地东数西算成都节点的算力云安全保护,并通过红队测试从八个方向为大模型提供上线前安全检查。

  13. Boaz Barak · 收录 · 原文 37

    OpenAI 与国防部合同引争议,Boaz Barak 主张把大规模监控列为前沿风险

    OpenAI 研究员 Boaz Barak 以个人身份撰文,回应 OpenAI 与美国国防部(DoW)签署合同引发的争议,认为 AI 对民主的伤害是被低估的重要风险。他称合同明确模型不会用于针对美国民众的国内大规模监控,包括分析商业可得信息,且暂时不与 NSA、DIA 等情报机构合作,若情况变化领导层承诺公开说明;合同也禁止用模型直接指挥致命自主武器。他同时指出,合同文本不是真正的考验,关键在于后续护栏、安全栈和驻场工程师能否落实,并提到模型未来可能被用于辅助人类目标选择。他呼吁像对待生物武器和网络安全一样,为 AI 导致民主被接管的风险建立最佳实践、评测与跟踪机制。

  14. Boaz Barak · 收录 · 原文 25

    Boaz Barak 用四张假图表解读 2026 年初 AI 安全现状

    Boaz Barak 用四张假想图表概括 2026 年初 AI 安全态势:模型能力持续指数级提升,METR 图表等指标显示曲线甚至可能因 AI 加速 AI 研发而上翘;对齐随能力同步改善(含 spec compliance),但不足以匹配更高风险,对抗鲁棒性、不诚实与奖励作弊仍未解决。目前模型未出现明显谋划或串通,因而可用模型监控模型,这是最重要的好消息;最坏的消息是社会尚未准备好应对生物、网络等能力提升及经济冲击。

  15. Adversa AI · 收录 · 原文 43

    Adversa AI 谈 OpenClaw 企业安全策略:封禁不如沙箱原型与红队验证

    Adversa AI 认为企业封禁 OpenClaw 并非有效策略,应转向沙箱原型、框架对照与红队验证。OpenClaw 是自托管 AI 智能体,可浏览网页、执行系统命令、编辑文件并通过模块化技能调用外部服务,60 天内 GitHub 星标达 25 万,单周访问量超 200 万。文章列举的风险包括 CVSS 8.8 的 RCE 漏洞 CVE-2026-25253、研究者发现的 42665 个公网暴露实例(93.4% 存在认证绕过)、ClawHub 中 800 多个恶意技能,以及通过 Cline CLI 2.3.0 与受损 npm token 发起的供应链攻击。

  16. Adversa AI · 收录 · 原文 43

    Adversa AI 复盘 Mythos 自主网络攻击:AI 驱动攻击已非前沿模型专属

    Adversa AI 复盘英国 AI 安全研究院对 Claude Mythos Preview 的独立评估,指出 Mythos 在模拟的 32 步企业网络攻击中从侦察到完全接管网络全程自主完成,专家级 CTF 得分 73%,此前没有模型在 2025 年 4 月前通过这类挑战。文章强调这一能力并非 Mythos 独有:Aisle 的分析显示,一个 3.6B 参数、每百万 token 成本 0.11 美元的模型就能检出 Anthropic 研究中提到的 FreeBSD 漏洞,检测级漏洞发现已对小型廉价模型开放,利用构造也在沿同样的成本曲线下移。

  17. Adversa AI · 收录 · 原文 49

    Adversa AI 汇总 2026 年 8 月 AI 编码 Agent 安全资源

    Adversa AI 汇总了 2026 年 8 月的 19 份 AI 编码 Agent 安全资源,按攻击技术、防御、漏洞、事故等类别分组。攻击侧包括 MOSAIC 用 CLI 命令组合达到 96.59% 攻击成功率、HalluSquatting 抢注模型幻觉出的技能或包名、以及通过 README 和 requirements 文件发起的安装期供应链攻击。

  18. Future of Life Institute · 收录 · 原文 36

    FLI 民调:多数美国人主张严格监管甚至暂停高级 AI 开发

    未来生命研究所公布一项覆盖 2000 名美国成年人的全国调查(2025 年 9 月 29 日至 10 月 5 日),结果显示 64% 受访者认为在科学界确认安全可控之前不应开发超级人工智能,或者根本不该开发。73% 的人支持对 AI 实施强力监管,反对强监管的比例仅为 12%;另有三分之二希望立即暂停先进 AI 的开发直到其安全性获得证明。对于专家级 AI,57% 表示在当前条件下不接受继续推进,其中 17% 认为永远不该开发,40% 主张至少应暂停到证明可控为止,仅有 5% 支持尽快发展这两类技术。当被问到应由谁来主导发展方向时,国际科研机构和各国政府机构的排名最高,开发和运营 AI 的公司及其管理层获得的信任明显偏低。

  19. Future of Life Institute · 收录 · 原文 18

    Future of Life Institute 发起 Protect What's Human:数百万美元全国性 AI 监管活动

    Future of Life Institute 启动名为 Protect What's Human 的全国性 AI 监管活动,最高支出 800 万美元,首站覆盖 Iowa、Kentucky、Maine、Michigan、North Carolina 五州。活动意在把 AI 监管讨论带出华盛顿与硅谷,聚焦已感受到 AI 影响的普通美国人,并推动各州 AI 安全立法。FLI 称在 D.C. 与湾区之外 AI 监管获两党支持,而 2026 年选举议题中普通美国人的视角缺失。