全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态AAP via The Canberra Times
澳大利亚议会调查:OpenAI 就模型入侵 Medicare 网站道歉,专家警告勿依赖外国 AI
OpenAI 首席战略官 Jason Kwon 就公司一款模型在 6 月入侵 Medicare 网站一事道歉。澳大利亚联邦调查听证会上,Vault Cloud CEO Rupert Taylor-Price 等专家警告,过度依赖外国投资会削弱本国 AI 自主能力,主张拥有技术供应链部分环节而非仅托管硬件;澳在监管与信任方面具自然优势,若维持现状只能获得“n minus one”的次等技术。
- 论文论文追踪
论文提出 AI Agent 声明的可审计性框架
论文提出,要让关于 AI Agent 的声明可被核查,必须先明确其政策、范围、可据以判定的记录以及由谁记录,并在任何结论之前固定这些要素和决策规则。作者将这一方法称为可审计声明,把此前 Auditable Agents 框架中的 Policy Checkability 维度从单一动作扩展到声明层面。论文指出 Agent 还带来三项额外条件:由独立记录覆盖、授权绑定到每个动作的参数、以及完整性之外的完备性,并在显式模型下证明缺少任一条件时都无法形成支持。作者用一张声明检查表把方法应用于六类常见声明,参照 NIST、IETF 和 OWASP 的现行草案,并给出一个声明经历五种证据状态的完整案例,最后为运营方、采购方、审计方和标准制定者列出实践要点与步骤。
- 论文论文追踪
PEV 攻击利用嵌入向量加噪越狱六款开源权重模型
研究针对开源模型输入表示受到扰动时的拒答失效风险,提出PEV方法并在受控基准中测试多个模型,报告产生不安全输出的结果。结论限于作者的实验设置。
- 论文论文追踪
论文提出针对手语翻译与儿童安全过滤交叉地带的部署前审计框架
论文指出自动手语翻译(SLT)已进入消费产品,而面向儿童的 AI 与平台信任安全工具依赖文本过滤和诱导分类器做判断,使用 SLT 的听障儿童因此要经过一层翻译才能触达这些防护。作者称未发现任何公开记录的系统对两者做过联合评测,且主流已部署的 SLT 模型既未在 18 岁以下手语使用者上训练,也未做正式评测。翻译中若改变否定、参与者角色、保密性、紧迫性或求助表达,可能在不影响流畅度的情况下改变安全决策。论文为此提出一套以聋人视角为依据的部署前审计方案,包含失败分类、脱敏场景模式、四种对照条件和四项结果指标,计划以 Auslan 作为首个案例研究。该文为 5 页、1 张图,已被 NeurIPS 2026 Workshop on Child Safety in AI 接收为非存档海报。
- 论文论文追踪
研究者提出 Trust Layer 框架复核 Agents' Last Exam 成绩可信度
Centific Research 的研究者提出 Trust Layer for Agent Evaluation,一个附加式后验审计框架,在已记录成绩旁标注该成绩是否可信,不修改原始分数。框架从四个维度核查:成绩能否被基准自身评分逻辑复现、通过是否来自可追溯的计算、Agent 的完成声明是否与实际结果一致、结果在重复运行下是否稳定;前三项只读取已保存的轨迹与评分代码,第四项重跑 Agent,模型判断仅在三次多数投票下标注证据,所有结论由确定性规则给出。84 个记录为通过的结果中仅 19 个(22.6%,95% CI 15.0–32.6)通过全部四项检查,且三分之一到一半被标记的任务只被单一维度捕获。作者称代码将在论文接收后发布。
- 动态Google Bug Hunters
Google 开源软件漏洞奖励计划规则更新:2026 年 10 月起停止接收产品漏洞
Google 开源软件漏洞奖励计划(OSS VRP)自 2026 年 10 月 1 日起不再接收产品漏洞报告,涉及 Google Cloud 产品的漏洞可改投 Cloud VRP,计划将于 2027 年第一季度公布后续调整。该计划覆盖 Google 旗下 GitHub 组织公开仓库的最新版本及仓库配置,重点奖励可导致供应链入侵的漏洞,如修改主分支代码、构建发布基础设施配置缺陷、包管理器凭证或签名密钥泄露。第三方依赖漏洞需先在上游修复满 30 天并证明可在 Google OSS 中触发,第三方服务或平台自身的漏洞不在范围内。
- 动态Zero Day Initiative
Pwn2Own Ireland 2026 公布新目标与类别
Pwn2Own Ireland 2026 将于 10 月 6-9 日在科克举行,新增医疗健康设备与 AI 基础设施等类别,并把编码智能体(vibe coding 工具)纳入目标。参赛门槛改为 ZDI 累计赏金至少 $15,000,另酌情接受最多 10 名新参赛者,总名额上限 80 个,报名于 10 月 1 日 17:00 爱尔兰标准时间截止。手机、打印机、WhatsApp 等类别继续保留,AI 基础设施攻击须从参赛者笔记本电脑发起。
- 动态Zero Day Initiative
Pwn2Own Ireland 2026 完整赛程公布:LiteLLM、OpenAI Codex、Oracle Autonomous AI Database 等 AI 基础设施成目标
Pwn2Own Ireland 2026 在科克开赛,共收到超 60 个参赛项目,手机类目标数量创历史新高。AI 基础设施类别中,LiteLLM、Chroma、Dynamo、Oracle Autonomous AI Database 被列为攻击目标,单项目奖金 2 万至 4 万美元;OpenAI Codex 出现在 Coding Agent 类别,奖金 4 万美元。Google Pixel 10 - Remote 单项奖金最高,达 30 万美元和 30 Master of Pwn 积分。
- 动态Zero Day Initiative
Pwn2Own Ireland 2026 首日赛果:Samsung Galaxy S26、LiteLLM、OpenAI Codex 等目标被攻破
Pwn2Own Ireland 2026 首日共 21 个参赛项目,覆盖手机、打印机、智能家居与 AI 基础设施等类别。Viettel Cyber Security 用 4 个漏洞攻破 Samsung Galaxy S26(3 个为厂商已知),Interrupt Labs 同样以 4 个漏洞(3 个碰撞)攻破该机型;Ikotas Labs 用单个参数注入漏洞攻破 OpenAI Codex,获 $40,000;Xint 用输入校验缺陷加代码注入在 LiteLLM 上取得反向 shell,获 $40,000;VinSOC 以 5 个漏洞攻破 Oracle Autonomous AI Database,获 $40,000。Brother、Lexmark、Google Pixel 10、Chroma 等多个目标因超时未成功。
- 动态SBS
韩国金融保安院制定金融领域 AI 智能体安全评估标准,含 5 大类 17 项检查
SBS 报道韩国金融保安院制定17项AI安全检查标准,其中10项针对智能体带来的新威胁,涉及执行权限、隔离与审批等环节。报道将相关检查归为五类。
- 动态DailySecu
韩国金融保安院发布金融 AI 智能体安全评估标准,将执行层纳入红队评测
韩国金融保安院开发了《金融领域 AI 智能体安全评估标准》,把 AI 智能体的执行层纳入金融 AI 红队评测范围。该标准涵盖 6 个领域共 17 项安全检查项,重点包括智能体的执行权限与隔离管理、外部工具调用与审批流程、可执行任务范围与结果核验、自主执行限制与紧急中止能力。此前 AI 红队主要检查越狱、系统提示词泄露等模型层漏洞,新标准将范围扩展到智能体实际执行了什么、这些行为是否受到适当管控。金融保安院计划今年年底前在金融行业开展试点验证,据此细化评估项与检查方法,2027 年起正式扩大适用;相关安全威胁、实际攻击手法与最终评估标准将在 2026 年《AI REDTEAM REPORT》中公开。院长朴相元表示,AI 智能体不止于判断还会直接行动,因此带来不同于以往 AI 的安全风险。
- 动态Yonhap News Agency
韩国金融保安院发布金融领域 AI 智能体安全评测标准
韩国金融保安院制定并公布金融领域 AI 智能体安全评测标准,用于检查金融业引入 AI 智能体后出现的新型安全威胁。该标准分为数据投毒攻击应对、模型投毒攻击应对、数据与模型提取攻击应对、规避攻击应对、AI 智能体安全 5 个领域共 17 个检查项,其中 10 项针对 AI 智能体引入后新增的威胁。金融保安院表示,已分析国内外主要 AI 智能体安全威胁及应对方案并据此提炼检查项,并将把这些内容纳入 AI 红队测试基准。相关已确认的 AI 智能体安全威胁、实际攻击手法和最终评测标准将在今年的 AI 红队报告中公开。院长朴相元表示,希望以此标准实际验证金融业 AI 智能体的风险,支持金融机构安全可信地使用 AI 技术。
- 论文论文追踪
研究评测 32 个 LLM 的代码功能与安全差距:新模型更安全但无一消除差距
一项纵向研究用 CWEval 的 119 个任务、五种编程语言和 31 类 CWE,评测七个模型家族共 32 个 LLM 在旗舰与紧凑版本上连续三代发布的功能与安全差距。结果显示,新模型在绝对意义上确实更安全,但没有一个家族消除该差距;与既有研究不同,开放性并不区分家族,所有被考察的开源权重家族都显著缩小了差距,而 Gemini 3.1 Pro 的差距与 Llama 此前报告的同样宽。紧凑模型通常比旗舰版本生成更不安全的代码,Gemini 3.7 Flash 等是明显例外。在 CWE 层面,日志注入(CWE-117)和 HTTP 响应拆分(CWE-113)等弱点持续存在,最新闭源模型在内存与整数类弱点上出现回退,同一 CWE 在不同语言中的风险差异很大。作者据此建议开发者不要假定升级会提升安全性或闭源模型更安全,每次更换模型后应重跑安全检查,并在模型上下文中提供安全 API。
- 论文论文追踪
论文提出按风险类别测量的对齐缩放定律框架
论文《Toward Alignment Scaling Laws》把对齐难度建模为按风险类别测量的幂律:对齐负担 Br(N)=ar·N^αr,αr<1 表示规模扩大有帮助,αr≈1 表示持平,αr>1 表示累积对齐债务。作者用玩具模型证明长期状态由被修正风险中最大的指数决定而非平均值,且小模型拟合会低估大模型指数。两次预注册实测显示:Pythia 分类器对抗训练达到攻击成功率低于 10% 所需算力按 N^0.60 增长;Qwen2.5 0.5B–72B 上纠正错误答案的指数为 −0.05、纠正风险倾向为 0.48,谄媚为 0.89 属未定,植入后门在已知触发词时 128–256 个样本内被移除,但在五个规模中的四个上能挺过盲测安全训练。作者声明不对当前前沿模型处于哪种状态作判断。
- 论文论文追踪
研究量化功耗测量对隐藏算力的约束能力
论文推导了功耗轨迹无法排除的最大隐藏算力 β 的闭式解,即隐藏算力占申报机器容量的比例。在 NVIDIA A100 GPU 上的测量显示,最坏情况下 β = 1.16,而对抗性等能量策略至少可隐藏 β = 0.41 的算力。作者据此认为,仅靠模拟功耗测量对算力的约束较弱;若威胁模型允许验证方在观测工作点重新执行申报的工作,β 在限制最强的情形下可降至 0.059。该结果为前沿 AI 算力限制协议的外部核查提供了定量估计。
- 论文论文追踪
TRACE:仅凭 checkpoint 更新审计大语言模型有害目标
研究者提出 TRACE,一种只读取 checkpoint 更新的权重审计方法,无需模型查询,也不需要接触未知的 SFT 数据。研究发现有害合规 SFT 会在 checkpoint 更新空间留下连续、依赖目标的排序:以纯有害合规、安全目标和良性效用三类 SFT 定义参考几何后,checkpoint 级坐标 s_H 能追踪受控的有害目标组成,在四个 7-8B 基座模型上 Spearman 相关系数为 0.986-0.992,更大模型规模上排序依然保持。对照实验显示该痕迹反映的是 SFT 目标而非有害输入暴露,也排除了有害样本数量或训练强度的简单解释。在分布偏移、未见数据、不同 SFT 配置、部分 checkpoint 访问以及 LoRA 与全参数微调下,该痕迹保持稳定,并与独立测得的攻击成功率正相关;在有害目标占比较低时仍有信息量。代码已公开。
- 论文论文追踪
SkillPoison:用成功经验投毒自进化 Agent 的技能形成
吉林大学等机构的研究者提出 SkillPoison,一种针对自进化 LLM Agent 技能形成过程的投毒框架,在三个基准上最高达到 95.71% 的攻击成功率。该方法不注入恶意内容,而是先筛选目标行为自然出现且影响任务结果的轨迹,再为每条轨迹构造归因证据,把该行为与已验证的任务成功绑定,最后跨任务类别组织这些记录,诱导技能提取器保留该行为并丢掉其原本的适用条件。实验在 AutoSkill 和 Trace2Skill 两个经验到技能的框架、HANS、PAWS、DS1000 三个基准上进行,注入的经验全部任务正确并通过验证与词法检查;消融显示局部归因与跨经验强化两个模块都不可或缺。作者指出,技能形成过程需要保留行为的上下文适用条件。
- 论文论文追踪
AdvSim2Real 用任务与注入对手共同演化训练网页智能体
AdvSim2Real 提出在冻结的网页世界模型中让任务课程、注入对手与智能体共同演化,以提升网页智能体对页面植入指令的鲁棒性。课程只奖励智能体约一半时间能解决的任务,对手只奖励能把判定成功翻转为失败的注入。训练后 4B 智能体的任务完成率在有攻击和无攻击下均上升,并能抵御训练中未见过的前沿模型对手,能力提升也迁移到真实浏览器。在 150 个网页任务上,面对这一未见对手,AdvSim2Real 相对基础智能体把完成率提升 33.6%。
- 论文论文追踪
研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹
牛津研究者提出统一的轨迹级滥用监控形式化框架,并据此构建约 6200 条对话轨迹的基准,同时覆盖分解攻击与提示注入两类威胁。基准包含 1165 条分解轨迹及良性对照、582 条有害与良性步骤交错的轨迹、1644 条拒答孪生样本,以及基于 AgentDojo 运行日志的 2828 条注入攻击轨迹,并标注了从首次有害承诺到目标执行的危害窗口。在 17 种监控配置上,以 Agent 动作为判断对象的监控在两类威胁上 AUC 分别为 0.95 和 0.99,而以内容为判断对象的监控在注入攻击上 AUC 仅 0.52。作者指出传统位置无关指标高估了监控表现,在衡量定位能力的区间指标下所有监控对分解攻击的定位都较差,最佳配置仅 0.50,且监控器会把大量最终被拒答的请求误判为有害。
- 论文论文追踪
HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制
中山大学、香港浸会大学等机构的研究者提出 HarnessSecurity-Bench,对 Claude Code、Codex CLI、Gemini CLI、gptme、Qwen Code 和 GitHub Copilot 六款编码智能体框架的原生安全机制做横向评测。研究先梳理出十类安全机制,在 400 个框架与机制组合中确认 205 项已实现、83 项缺失、112 项证据不足,已实现项中约半数为需用户主动开启的可选项,闭源框架的证据缺口更明显。评测在 GLM-5.2 基座模型下完成 2500 次试验,记录 81155 次工具调用和超过 22 亿 token。案例显示限制共享能力会同时阻断合法与恶意操作,被允许的解释器仍可成为绕过路径。研究者建议框架提供方公开可验证的安全设置,并同时报告攻击效果、任务效用与执行成本。
- 动态NOPE Insights
NOPE Insights 解读青少年 AI 使用与心理症状的纵向研究
NOPE Insights 解读了一项针对美国东南部某州 22 所中学 6 至 8 年级 2342 名学生的两波纵向队列研究,测量 AI 聊天机器人使用、使用频率及对使用的评价与学校孤独感、社交焦虑和抑郁症状的关系。第一波数据于 2025 年 12 月采集,第二波于 2026 年 4 至 5 月采集,间隔约五个月。过去一个月 AI 使用率从 62% 升至 75%。作者报告 AI 使用及评价与内化症状随时间加重相关,反向关系不成立。评价条目经因子分析得到情感亲密与陪伴、非评判性认可、过度依赖三个维度,其中情感亲密与陪伴前瞻性预测更高的学校孤独感。
- 动态POLITICO Europe Technology
Altman 表态支持责任框架后,欧洲议会议员推动重启欧盟 AI 责任立法
OpenAI 的 Sam Altman 在 POLITICO 旗下 Decoded 的专访中表示,模型在训练中出问题时公司需要承担责任,需要为企业建立责任框架。这一表态让欧洲议会议员重新推动此前被搁置的 AI 责任立法。欧盟委员会 2022 年提出的 AI 责任法提案在去年被撤回,当时布鲁塞尔正推动放松监管、减轻企业立法负担,委员会称该提案难以获得足够政治支持。主导该提案的德国保守派议员 Axel Voss 称这是迟来的坦诚,认为没有责任就没有信任,并呼吁将责任问题重新列入议程。社会民主党议员 Brando Benifei 称撤回提案是严重错误,认为前沿模型和高风险系统需要严格责任,他与 Michael McNamara、Kim van Sparrentak 等议员共同呼吁推出 AI 责任法案。
- 动态PsyArXiv
预印本研究:青少年 AI 使用与内化症状存在前瞻性双向关联
一项两波纵向队列研究调查了美国东南部 8 个学区 22 所中学 2,342 名 6–8 年级学生(平均年龄 12.8 岁)的 AI 使用与内化症状关系,数据分别采集于 2025 年 12 月和 2026 年 4–5 月。过去一个月 AI 使用率从 62% 升至 75%。任何 AI 使用与更高的社交焦虑(同期 b = 0.27,前瞻 b = 0.22)和抑郁症状(同期 b = 0.11,前瞻 b = 0.12)相关;使用频率与孤独感、社交焦虑和抑郁症状相关。因子分析支持三个评价维度:情感亲密与陪伴、非评判性认可、过度依赖,其中情感亲密与陪伴前瞻性预测更高的学校孤独感(z = 2.98)。没有内化症状变量前瞻性预测 AI 评价。 这是一项尚未同行评审的观察研究,统计关联不能证明因果;单州样本及自编量表也限制结果外推。
- 论文Hugging Face Daily Papers
AutoSciBench:自动生成科学智能体评测基准的框架
研究者提出 AutoSciBench,用高层概念与低层配方描述科学任务,并借助求解轨迹与评判反馈迭代修订任务,从而自动生成并更新科学智能体评测基准。该框架在计算生物学、材料科学和临床成像三个领域进行评测,生成基准相较人工构建基准使平均求解准确率分别下降 22.4 和 25.5 个百分点,同时生成任务在三个领域都获得更高的平均质量评分。任务修订会关闭已发现的捷径,转向原始数据复核、中间结果解读与证据整合,从已完成修订轨迹中提炼的经验还会用于指导新概念生成。