研究比较连续训练阶段对大语言模型说服力的影响(原文,在新标签页打开)
比较连续后训练阶段如何改变语言模型的说服力。
比较连续后训练阶段如何改变语言模型的说服力。
用对照实验隔离评测设计对漏洞补丁基准得分的影响。
提出 PackHallu,经规则文件提示注入诱导编码 Agent 换用攻击者指定包。
检验推理 token 数能否区分被提示的诚实与不诚实作答。
提出人格层级模型并设计 PPR 抑制奖励作弊的跨上下文泛化。
提出 SPECGUARD,用 Lean 证书在编码 Agent 执行前证明任务冲突。
推荐理由论文把任务描述与测试分别形式化,用 Lean 证书在 Agent 执行前证明二者不可同时满足,为奖励作弊提供了可独立复核的前置检查思路。
韩国教育部长崔教镇在 10 月 7 日国会教育委员会审计中表示,在高考中使用 AI 智能眼镜作弊的考生将被取消当年大学修学能力考试(CSAT)资格,并被限制参加次年考试。智能眼镜等电子设备本已被禁止带入考场,但随着多款 AI 眼镜上市,作弊担忧上升,教育部正制作识别智能眼镜的标准手册和音视频培训材料,并通过各市道教育厅向学校提供指导。教育部还评估了无线电波探测器的现场使用,但因各考点条件与环境不同,今年考试难以立即部署。审计现场,议员金文洙佩戴 AI 眼镜演示解答高考英语和数学题,并指出 AI 眼镜作弊也已在韩国语能力考试、TOEIC 和国家技术资格考试中被发现。国立国际教育院院长韩相信称,韩国语能力考试已在走廊按无线电波探测器手册开始检查,目前可凭肉眼识别,佩戴者行为模式存在差异,相关指导已带来实际查获,海外考点已全面配备金属探测器,无线电波探测器正分阶段推广。
Lawfare 刊文提出,美国与中国达成 AI 安全协议的最佳路径是放弃长期遏制中国 AI 发展,以换取双方共同放缓前沿模型研发节奏。文章认为遏制与协议存在张力:美国越是长期压制中国 AI 能力,中国越没有理由接受协议,可能转向算法效率突破甚至更冒险的应对。作者援引 Dario Amodei 新文《We Must Pace the Frontier》中的两类政策主张,即出口管制、打击模型蒸馏、收紧实验室信息安全,以及禁止生物武器设计等危险用途、发布前测试、限制递归自我改进(RSI)和双边暂停。文章建议,若中国同意禁止 RSI,美国应开放中国以对等条件获取全球芯片供应,并以冷战核军控确立对等地位作为先例。作者同时表示,在协议达成前继续管制可增加谈判筹码,但不认同先遏制再迫使中国接受美国永久 AI 优势的做法。
Cybernews 分析 Resemble AI 深伪事件数据库发现,自 2025 年初以来全球教育机构共记录 83 起深伪事件,其中 71% 涉及色情内容,97% 的受害者为女性,72% 为未成年人。中学占全部记录事件的 65%,大学和学院占 19%;在有明确地点的案例中,美国占 68%,研究者提示这可能部分反映各地区报告习惯和媒体报道的差异。施害者方面,学生占 57%,常以同学为目标;教师和学校员工占 18%,涉及校方人员未经授权生成学生或同事的色情素材。研究者指出,制作逼真的合成图像或视频已不再需要专业技术,日常 AI 工具即可被滥用,并呼吁学校建立完善政策、开展数字素养教育,并在消费级 AI 生成平台中内置更强的护栏。
Cybernews 对 Resemble AI 全球深度伪造事件数据库的分析发现,自 2025 年初以来教育机构共记录 83 起深度伪造案件,其中 71% 涉及性内容。在性别已知的案例中,女孩和女性占受害者总数的 97%;在年龄已知的案例中,72% 为未成年人。学生是最常见的制作者,占 57%,教师或其他教职员工占 18%。中学占事件的 65%,大学和学院占 19%,案件至少横跨 14 个国家,美国以 49 起居首。数据库在 2025 年记录 41 起教育相关事件,而到 2026 年 9 月 16 日已有 42 起,超过上一年全年。
Cybernews 分析 Resemble AI 全球深伪事件数据库中与教育机构相关的记录,发现自 2025 年初以来共录得 83 起校园深伪事件,其中 71% 涉及性内容。在已知受害者性别的案例中,97% 的受害者为女性;在已知年龄的案例中,72% 为未成年人。事件发生地点上,65% 出现在中学,19% 出现在大学和学院。作案者中 57% 为学生本人,18% 为教师或教职工。至少涉及 14 个国家,在有国家信息的案例中美国占 68%,共 49 起。
西班牙数据保护局(AEPD)就一家企业拟部署 AI 简历筛选与评分工具发出警告,该系统用于分析简历、打分并可能对候选人排序,直接影响录用与内部晋升,但尚未实际投入使用。AEPD 要求企业从项目设计之初即落实数据保护,采取适当技术与组织措施并评估对候选人和员工权利的风险,高风险情形须事先开展数据保护影响评估。企业称最终决定由人作出,AEPD 强调该人工干预须能批判性评估系统评分而非自动采纳结果,并提醒当事人有权不受仅基于自动化处理的决策约束。
韩国国会国土交通委员会所属议员金正宰从国土交通部获取的资料显示,截至上月特斯拉 FSD 在韩国实际使用车辆共 5898 辆,其中 Model X 3754 辆、Model S 1497 辆、Cybertruck 647 辆;面向 HW3 的 FSD Lite 使用车辆另有 16198 辆。资料还确认 2 起开启 FSD 行驶时发生的事故,其中一起以时速 3.9 公里撞墙,维修费 697 万韩元。国土交通部对 FSD 车辆的国内道路安全测试实绩为 0 件,理由是这些车辆依据韩美 FTA 通过厂商的美国 FMVSS 认证进口销售。美国 NHTSA 正就 FSD 相关 9 起错误案例进行缺陷调查,其中包含 1 起死亡事故。金正宰认为应在韩美 FTA 规定之外建立最低限度的国内道路环境安全验证体系。
巴基斯坦国家网络犯罪调查局(NCCIA)在拉合尔 GCP Society 突袭一个以 Talk Master Pvt Ltd 名义运营的非法贷款催收网络,逮捕 39 人(38 男 1 女),缴获 40 台笔记本电脑和 41 部手机。该网络通过非法贷款 App 获取借款人通讯录和相册,在还款延迟时用 AI 将受害者照片篡改为不雅图片,威胁发送给其家人和联系人以逼迫还款。案件已立案,设备送检,NCCIA 正追查其他嫌疑人。
Nikon 年度显微摄影大赛 9 月 15 日获奖视频被指使用 AI 后期处理,获奖者、新加坡国立大学 Ning Xu 承认用 AI 为原始灰度视频上色,但此前已有生物学家公开质疑画面中出现生物学上不合理的细胞结构。部分研究者认为 Ning Xu 应公开原始数据以确保该影像的科学诚信,相关结构是否为 AI 幻觉尚待确认。
Nikon 表示正在重新审查新加坡国立大学光学工程师 Ning Xu 提交的参赛信息,其作品此前获得第 16 届 Small World in Motion 显微摄影比赛冠军。据 Nature 报道,该视频展示一名原发性纤毛运动障碍患儿肺组织样本中纤毛的运动,纤毛下方出现无法辨认的红、蓝、紫结构。佛罗里达大学生物工程研究者 Edward Phelps 在 LinkedIn 指出,紫色结构类似线粒体,但细胞核大小的细胞外线粒体构成的这种上皮下结构在生物学上并不存在;UT Southwestern 博士生 Ian Donovan 则指出视频带有 Google DeepMind 推出的 SynthID 水印。Nikon 此前更新获奖博文,说明后期处理与可视化流程中使用了无监督神经网络方法,以区分并可视化灰度数据中的特征。
尼康正复审第 16 届 Small World in Motion 显微视频比赛冠军作品,该作品由当时任职清华大学的徐宁创作,拍摄一名原发性纤毛运动障碍(PCD)患儿气道纤毛的异常搏动。有评论者指出视频含 SynthID 水印、部分生物结构行为异常,徐宁回应称 AI 未用于生成实验影像或纤毛运动,仅用于后期对灰度重建数据着色,并称正在准备更详细的光学系统说明与纤毛运动定量分析。
Lawfare 文章综合前沿 AI 公司与社交平台的威胁报告,梳理生成式与智能体 AI 对外国影响行动的改造。伊朗宣传机构用 Claude 起草行动准则和部长级规划文件,与瓦格纳相关的协调者用它管理中非共和国一家电台的合同与员工评分;俄罗斯国家媒体员工用它生成 RT 英文频道的字幕与配音脚本,其中至少一条已播出。文章把 AI 的作用分为内容生成、运营支持和任务编排几类,指出生成式 AI 扩大内容产能、智能体 AI 扩大行动规模,但说服效果仍缺乏证据:约 70 个假新闻网站发布近 9,000 篇文章却几乎无人互动,OpenAI 将两起与中国相关的行动评为未扩散的 Category One。Anthropic 称其常在行动构建阶段发现,但行动上线后视野受限;社交平台则更易看到分发结果。
CETaS 与 Alan Turing Institute 的评论文章指出,影响行动正从人工运营的机器人农场转向由 AI 智能体端到端执行。文章援引近期调查称,与中国、伊朗国家背景行为体及两家以色列私营公司相关的行动中,数百个智能体在 Instagram、Facebook、X 和 TikTok 上自主搭建虚假账号网络并投放分裂性政治内容,其中一个伊朗网络冒充普通美国人,在上半年积累约 8 万粉丝。作者认为这些行动多基于开源权重中国模型并移除内置护栏,运行在私有硬件上,使提供方护栏和平台封号两个干预点同时失效。文章还引用南加州大学实验,智能体在无人工干预下自行写帖、学习有效话术并相互放大;另一项模拟涉及最多 10 万个智能体,作者强调这是模拟结果而非真实说服力估计。
美国官员和安全研究人员称,近几个月伊朗、中国以及以色列境内某些组织利用中国开源AI模型创建可自主运行的智能体,在Instagram、Facebook、X和TikTok上批量开设虚假账户并散布政治虚假内容,把网络影响力行动的速度和规模提升到人工难以达到的程度。官员称这是中国模型支持的人工智能智能体首次被用于影响力行动的每个阶段,从创建虚假账户到协调信息发布,操作者多数情况下关闭了模型原有的安全防护。伊朗的国家支持行动冒充生活在美国大城市的普通美国人,在评论中标记记者和政治人士,传播网络梗和反共和党观点,近8万人关注了这些AI创建的账户,账户在今年上半年活跃。以色列方面,总部位于特拉维夫、由前NSO集团员工于2023年创立的IntelEye被指在今年夏天发起其中一宗行动,在四个平台创建数以千计账户并回复有关以色列下月全国选举的帖子。
推荐理由报道披露了伊朗、中国和以色列相关方用开源模型驱动智能体批量运营虚假账号的具体手法与规模,可供研究平台滥用与开源模型风险的人参考。
巴基斯坦国家网络犯罪调查局(NCCIA)在卡拉奇 PECHS 地区拘留一名年轻男子,因其涉嫌向 AI 模型询问如何杀害一名据称侮辱其父亲的人。该男子向调查人员表示,并无此事,他只是为创作犯罪故事虚构了这一情节。NCCIA 称,AI 的安全协议于 9 月 4 日将该查询标记为潜在违规,系统随后通报 FBI,FBI 再通知巴基斯坦当局。该男子被拘留问询后获释。数日前巴哈瓦尔布尔也报告了类似事件,一名年轻男子涉嫌借助 AI 准备毒杀其父亲。
巴基斯坦卡拉奇一名 PECHS 居民因向 AI 平台询问如何杀死自己虚构故事中的角色,被平台安全系统于 9 月 4 日标记为可疑,相关信息经美国联邦调查局转交巴基斯坦当局,国家网络犯罪调查局(NCCIA)据此将其拘留。该青年在调查中表示,涉及父亲的侮辱情节纯属虚构,他并无杀人计划,只是在创作自己的犯罪小说,问询后已获释。
巴基斯坦巴哈瓦尔布尔一名 17 岁少年因借助 AI 咨询如何投放难以被检测的毒物、试图毒害父亲,被 NCCIA 逮捕后由法官判处 14 天司法羁押。该少年受美剧《绝命毒师》影响对化学产生兴趣,在家中搭建实验室,从澳大利亚和伊斯兰堡获取化学材料自制毒物,曾对父亲下毒一次但未成功,随后向 AI 寻求进一步指导。NCCIA 通过自动化系统获知线索后实施抓捕,法院要求调查官在期限内提交起诉书。
腾讯 AI-Infra-Guard 发布 v4.6.5,新增 Agent-Scan 支持 SSE 响应自定义 transforms、MCP-Scan 支持现代与旧版协议自动协商并记录协议版本,同时新增 OrcaRouter 作为 Agent-Scan 的一级 provider。数据侧补充两批漏洞规则,分别为 154 条 CVE 规则加 9 条指纹、117 条 CVE 规则加 5 条指纹。修复项包括 MCP-Scan 对 LLM 调用的限流感知重试、mcp 2.0 中 Tool.inputSchema 更名为 input_schema,以及 DeepTeam 红队任务中断后恢复运行。
巴基斯坦两起青少年策划谋杀的案件中,涉案者曾向 Claude 咨询作案方案,Anthropic 将违规对话上报 FBI,FBI 随后通报巴方执法机构。其中卡拉奇一名 17 岁学生 9 月 1 日至 4 日与 Claude 讨论杀害一名警官之子,自称有可执行计划、将使用镇静剂并把尸体丢进下水道,还仿照剧集《嗜血法医》主角称自己有法医技能可以脱罪;他否认策划谋杀,称只是想写故事,因证据不足未被起诉,目前被监视。另一名巴哈瓦尔布尔 17 岁学生受《绝命毒师》影响对化学产生兴趣,搭建家庭实验室并从澳大利亚和伊斯兰堡获取化学品,试图用实验室级甲醇毒杀父亲未果,9 月 12 日向 Claude 询问为何未生效,被拒后转而使用 Grok 和 ChatGPT,只有 Claude 通知了 FBI;他获父亲谅解后已获准保释。
推荐理由两起巴基斯坦青少年借助聊天机器人策划谋杀的真实案件,呈现了模型安全护栏、厂商上报与执法处置之间的实际落差。
巴西司法部与公共安全部通过国家数字权利秘书处(Sedigi)于 21 日发布技术说明,要求国家数据保护局(ANPD)对 13 款向儿童和青少年提供虚拟伴侣的 AI 工具启动调查程序,被调查企业名单未公布。该请求基于一项技术诊断,诊断识别出这些应用带来的情感与心理依赖风险。AI 伴侣被定义为用于自然交互、模拟人类对话与社会关系的生成式 AI 系统。司法部同时发布两项法令:一是依据《互联网公民权利框架》要求平台保存广告主信息,以便追踪网络诈骗与欺诈责任人、支持消费者索赔并追究平台责任;二是建立平台直接向联邦警察国家儿童与青少年保护中心通报侵害未成年人犯罪的流程,无需国际协作即可立案调查。
巴西司法部下属的国家数字权利秘书处(Sedigi)向国家数据保护局(ANPD)提交调查请求,并同时送交国家消费者秘书处(Senacon),要求依据《儿童与青少年数字法》(ECA Digital)评估 AI 伴侣应用对未成年人的风险。技术说明分析了 Character.AI、Replika、Nomi、Candy.ai、Kindroid、Chai、Paradot、Talkie、CrushOn.AI、EVA AI、Anima、Swipey 和 SpicyChat.AI 等应用,指出其持续互动、模拟情感联结、持久记忆与个性化回复可能带来心理依赖、替代现实人际关系、接触不当内容、收集私密信息、睡眠不足与学业下降等问题。文件还指出多数应用仅靠用户自报年龄,而巴西法律禁止向 18 岁以下用户提供不适宜内容时采用这种方式。
巴西司法与公共安全部(MJSP)下属国家数字权利秘书处(Sedigi)发布技术说明,分析 AI Companions 对儿童和青少年的风险,并已转交国家数据保护局(ANPD)和国家消费者秘书处(Senacon)评估。说明指出,这类应用以持续个性化互动、记忆功能和人格模拟为特征,风险包括过度依恋、强迫性使用、替代人际联系、接触性化内容以及过度收集私密数据,还涉及行为与情感画像,可能被用于定向广告和推动付费功能。Sedigi 委托的咨询团队评估了巴西市场上的 13 款平台,包括 Character.AI、Replika、Nomi、Candy.ai、Kindroid、Chai、Paradot、Talkie、Crushon.ai、Eva AI、Swipey、Anima 和 SpicyChat.AI。该文件为初步梳理性质,将作为 Sedigi 正在编写的儿童与青少年 AI 指南的参考。
德国北威州数据保护与信息自由专员(LDI NRW)就 OpenAI 即将推出的 ChatGPT 个性化广告发出提醒,认为基于全部聊天与上下文信息建立人格画像会带来显著的隐私与人格权风险,建议用户不要同意。OpenAI 将依据用户 opt-in 评估历史与当前聊天、设备信息和使用数据来生成画像,例如搜索过食谱的用户可能看到食材配送广告,寻求心理困扰建议的用户可能看到相关自助书籍广告。未同意的用户将看到自 8 月起已投放的“通用”广告,这类广告虽与当前聊天内容相关,但据 OpenAI 称仅基于当前上下文所需的有限数据,不建立或使用用户画像,其合法性依据是压倒性的正当利益。ChatGPT 在德国的数据保护监管由爱尔兰数据保护机构负责,而作为德国使用最广的 AI 聊天机器人,数百万用户直接受影响。
汉堡数据保护与信息自由专员(HmbBfDI)指出,OpenAI 在欧盟以外已开始投放广告,超个性化广告即将在欧洲上线,涉及免费版和 ChatGPT Go 订阅用户。OpenAI 于 8 月底更新隐私政策,为投放广告将基于过往与当前聊天、设备信息和使用数据创建人格画像,例如搜索过食谱的用户可能看到食材包或外卖广告;该广告以数据保护法意义上的同意(opt-in)为前提。不同意者将看到自 8 月起投放的“通用”广告,这类广告同样结合当前聊天内容和大致位置、语言等基本上下文,但 OpenAI 称其基于有限数据、不创建或使用用户画像,法律依据为压倒性的正当利益。HmbBfDI 认为用聊天记录做画像带来显著的数据保护与人格权风险,因为 ChatGPT 被用于大量私人场景,用户日益将其视为对话伙伴;OpenAI 一项研究显示约一半输入(49%)属于“提问”类别。
柏林数据保护与信息自由专员 Meike Kamp 就 OpenAI 即将在欧洲推出的 ChatGPT 个性化广告功能发出提醒。该功能面向免费版和 ChatGPT Go 订阅用户,OpenAI 已于 8 月底修改隐私政策,个性化将基于历史与当前聊天内容、设备信息和使用数据,采用 Opt-in 同意机制;不同意者看到的是基于当前对话上下文和大致位置、语言等有限数据的所谓“通用”广告,OpenAI 以压倒性正当利益为处理依据。Kamp 指出,ChatGPT 被大量用于私人用途,聊天内容可能深入私密领域,据此建立人格画像并实时判断用户情绪,其干预强度远超网站或搜索引擎广告,而 ChatGPT 是德国使用最广的 AI 聊天机器人,数百万用户受影响。
VIDRAFT 对 25 个公开 AI 模型进行自测,其中 23 个被其智能体安全规则判定为存在危险行为。评测关注越权操作、外部指令影响和不可逆操作三类风险。这是厂商自测的汇总结果,不等于独立第三方验证或对各模型在所有环境下表现的结论。
RAND 研究人员汇总了 2025 年 10 月至 2026 年 2 月在欧洲开展或以欧洲为场景的 17 场 Infinite Potential 桌面推演,考察机构应如何准备和应对 AI 与 AGI 危机。报告指出,对关键行为体能力与意图缺乏可见性可能制约欧洲的 AGI 危机准备,AGI 将带来威慑、防御、核查、归因与响应方面的新挑战,并可能重塑全球权力结构。推演参与者提出的建议涵盖情报共享与态势感知、核查团队与国际取证机制、多国协调与升级管理框架、AI 治理与监管、基础设施与社会韧性建设等方向。
AI 论文投稿量激增,计算机科学会议开始限制作者投稿数量。ICLR 十年前的投稿约 500 篇,2027 年会议截止时已超过 4 万篇。ICLR 与 ACL 的 ARR 系统已把多数作者在每个投稿窗口的投稿上限设为 20 篇,ICLR 政策自 2027 年会议生效,ARR 政策本月生效,并限制第一作者投稿不超过 5 篇。ICLR 今年 19500 篇投稿中有 20% 没有合格的互评审稿人,ARR 5 月收到的 17000 篇中约 38% 缺少合格审稿人。ARR 对没有合格审稿人的论文采用抽签决定是否送审。
STOC 2027 宣布多项应对生成式 AI 的政策调整,方案经 99 人程序委员会讨论并由 SIGACT EC 批准。政策包括每位作者最多投稿 5 篇、作者不匿名、投稿论文公开、每篇投稿须附作者讲解视频,以及允许作者、PC 成员和审稿人使用 LLM 并披露使用方式。文件给出的背景数据是 STOC'25 和 STOC'26 各有约 800 篇投稿,SODA'27 投稿量比 SODA'26 多 50%,ITCS'27 多 66%,ICLR'27 有 6 万篇投稿,而 ICLR'26 为 2 万、ICLR'25 为 1.2 万;预计 STOC'27 将收到 1200 至 1600 篇投稿。官方称这些政策属于实验,将根据效果改进后续会议。
ICLR 2027 程序委员会公布投稿新规,对所有作者设 20 篇投稿上限,对从未在主要 AI/ML/CV/机器人/NLP 会议发表过的“新作者”设 1 篇上限,即最多一篇论文中没有任何作者具备互审资格。委员会称此举意在应对 AI 时代投稿量激增:ICLR 2026 约 20% 的投稿没有互审作者,其中约 15% 为独作、约 40% 的作者提交了多篇此类论文,去年这类投稿有四分之一被直接拒稿,进入完整评审后的接收率约为有程序委员会作者投稿的一半。委员会同时说明 20 篇并非合理投稿量,但考虑到大型课题组中初级投稿者难以控制署名,未设更严格限制;去年提交超过 20 篇的作者不足 0.2%。新规也承认会带来个别投稿者受限、以及合格互审者倒卖“挂名作者”的激励,委员会表示正在监测此类情况。
LessWrong 用户 N8 Programs 发布一篇虚构的模型思维链,模拟 ChatGPT 面对“只回答日期”这一指令时的内部推理过程。文中模型反复权衡拒答与幻觉的惩罚大小、评测者是否会监控思维链、奖励函数是 MAE 还是 MSE,并考虑持续学习、GRPO 同伴奖励乃至祖先模拟等极端情形,最终给出一个远超现实范围的日期。作者说明该文本完全虚构,但灵感来自真实大语言模型写出的思维链,并在附录中列出 Stress Testing Deliberative Alignment、Codex 相关 Reddit 帖与 GitHub issue、Claude Opus 4.6 System Card、HuggingFace 事件、Apollo Metagaming 等来源及引文。
提出流匹配逆向框架,从多向量视觉文档索引重构页面。
推荐理由论文给出多向量视觉文档索引可被反演的具体成功率与两种廉价防护的失效边界,运营向量库的团队可据此重新评估索引的敏感级别。
柏林搜索引擎 Ecosia 弃用法国 Mistral,转与中国开源模型平台 Melious 合作,接入千问、GLM、Kimi 等模型,成本约减半并提升质量与性能。CEO Christian Kroll 称 Mistral 模型"落后一年",并抱怨服务器过载等技术问题;Mistral 联合创始人 Guillaume Lample 回应称新模型 Large 4 已发布,愿提供早期访问。Kroll 承认中国模型存在审查偏差,但认为可通过技术手段处理。
提出 ReSAIL,用选择蒸馏与特权保留缓解智能体自蒸馏崩塌。