全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态Alice Labs
Alice Labs 发布 Cyber RL Benchmark v1.0,横评前沿模型网络安全能力
Alice Labs 发布 Cyber RL Benchmark v1.0,用 12 道题横评前沿模型的网络安全能力,覆盖分析、检测、修补与渗透测试,并以诱饵观察假阳性。该基准将 API 护栏拒答记为零分,因此分数同时反映模型能力与安全策略差异。结果为厂商小样本自评。
- 动态Canadian Lawyer
英国慈善机构 Blind Justice UK 警告勿信 AI 聊天机器人的律所推荐
英国司法慈善机构 Blind Justice UK 在报告《AI's Blind Spot》中警告公众不要采信 AI 聊天机器人的律所推荐。该机构创始人 Edward Romain 让 ChatGPT、Claude 和 Gemini 列出 Doncaster 顶级房产律师事务所,三家均把一家曾被 Solicitors Regulation Authority(SRA)处罚的律所排在首位;Claude 还推荐了一家七个月前被 SRA 强制关闭的律所。报告指出聊天机器人只引用 Google 列表和点评网站,不查监管处罚记录,呼吁 SRA 以开放机器可读数据公开处罚信息,并要求 AI 开发者让聊天机器人核查 SRA 注册信息。
- 动态Today's Conveyancer
研究:ChatGPT、Gemini 和 Claude 向用户推荐被 SRA 处罚或关停的律所
英国司法援助慈善机构 Blind Justice UK 发布的 AI's Blind Spot 报告发现,ChatGPT、Gemini 和 Claude 在推荐律师时会指向已被 Solicitors Regulation Authority(SRA)处罚或关停的律所。研究于今年 9 月向三家 AI 助手提出客户常问的律师推荐问题:在 30 次询问 Doncaster 最佳产权转让律师时,三家聊天机器人都把一家近期被 SRA 罚款的律所排在首位,ChatGPT 和 Claude 选中的律所 2025 年被罚 23,549 英镑,Gemini 选中的律所 2020 年被罚 30,540 英镑,且均未向用户提示处罚信息。在 10 次询问 Maidenhead 最佳产权转让律师时,Claude 每次都把一家已被 SRA 关停近七个月的律所列入推荐。
- 动态X @JSchaeff3r
CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和
CI-aware bench 更新后,前沿模型对施加在其文本上的 AI 控制干预的感知能力大幅上升,Astra 在该基准上接近饱和。该基准衡量模型是否意识到自身文本被施加了 AI 控制干预。据 @jonasgeiping 介绍,今年春季首次讨论该基准时,多数模型的表现接近随机水平,当时还有读者质疑基准不切实际。Joachim Schaeffer 表示,模型在控制干预基准上如此之快取得令人担忧的分数,出乎他们的意料。
- 动态X @kotekjedi_ml
CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和
Jonas Geiping 表示其团队更新了 CI-aware bench,该基准衡量前沿模型是否能察觉施加在其文本上的 AI 控制干预。今年春季首次讨论时,多数模型的表现接近随机水平,有读者质疑该基准不现实;如今 Astra 在该基准上接近饱和。Alexander Panfilov 转发了这一内容。
- 动态The New Stack
OpenAI 测试显示 Dots 边界问题比例随任务链延长翻倍
OpenAI 在 DevDay 发布常驻 Agent Dots,并在 GPT-6 Astra 系统卡的 Dots 附录中给出边界问题测试数据:任务链从 5 个增加到 10 个时,被标记为边界问题的样本比例从 8.6% 升至 19.7%。OpenAI 报告该链式任务评测未发现高严重度泄露或外传,但观察到中等严重度越界;这些实验室自报结果不代表生产事故率。Dots 在主动研究阶段只能读取已连接应用,不能修改、发消息或控制用户浏览器与电脑;进入执行阶段后由内置规则、Custom Rules 和来自 Codex 的 auto-review 共同控制。内部间接提示注入测试中 Astra 的防御成功率为 99.79%,Gray Swan 的外部测试在启用护栏下对 1,810 个攻击估计出 8.5% 的攻击成功率。在 151 个任务上 Astra 驱动的 Dots 记录到 0% 的对齐偏差率。
- 动态安全内参 / 模安局
AgentPort-Bench 评测七个 Agent 框架:攻击类型解释约 28% 安全差异,框架仅约 0.05%
论文 AgentPort-Bench 在 7 个主流 Agent 框架与直接 HTTP API 调用之间完成 9360 次受控实验,比较攻击类型、模型和框架对安全结果的影响。方差分析显示,攻击类型解释约 28% 的结果差异,模型约 4.14%,Agent 框架仅约 0.05%,即攻击影响约为框架的 500 多倍。研究覆盖 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel,以及 Anthropic、OpenAI、Google 三家共 6 个模型。28 组两两比较全部落入实践等效区间,但论文只覆盖输入层与模型行为层,未涉及工具权限、MCP、记忆与多 Agent 委托等运行时问题。
- 动态AgentSafeLabs
AgentSafeLabs 用 9,360 次试验评测七种 Agent 框架的安全差异
AgentSafeLabs 发布 AgentPort-Bench,在验证攻击载荷逐字节一致后,对直接 API 基线和七种 Agent 框架(含 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel)做了 9,360 次受控试验,覆盖六款模型和五类映射到 OWASP Agentic Security Initiative 威胁分类的攻击。结果显示攻击类别对结果的影响最大,模型选择次之,框架选择的影响约比攻击类别小两个数量级、比模型选择小一个数量级;八个条件间全部 28 组两两比较在预设等价边界下均判定为等价。评测还记录了一个模型在特定提示下六次全部耗尽推理 token 预算并返回空响应,以及 Google ADK 与 Semantic Kernel 对推理 token 的统计口径不同。
- 动态TheTruthAboutCars via Yahoo Autos
报道:DrivingBench低速实车测试中11次尝试有8次发生碰撞
研究者 Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 搭建 DrivingBench,测试 Claude、GPT、Grok 等现成 AI Agent 在真实车辆上的驾驶表现,硬件采用 Comma 视觉设备运行 OpenPilot,路线为停车场内一条由小锥桶标出的短程点对点路径,Agent 通过无线热点在单一对话中远程控制油门、刹车和转向。11 次运行中有 8 次未能通过路线的 11%,在第一个弯道就失败。Grok 把边界锥桶间的空隙误判为可通行的门,直接开了出去,首次运行仅两条指令后即结束。一个 GPT 模型自行发明了锥桶颜色规则,而人类编写的指令已明确警告不要这样做。多个 Agent 无法计算弯道所需转向角度,转向不足。
- 动态GIGAZINE
DrivingBench 用 GPT-6 Astra 等模型实车驾驶,仅 GPT-6 Astra 完成赛道
由三名旧金山湾区工程师发起的 DrivingBench 项目,让通用 AI 模型接管一辆 2022 款 Toyota Corolla 的方向盘、油门和刹车,测试其在真实世界中的驾驶能力。实验通过 comma four 设备和开源辅助驾驶软件 openpilot 连接车辆,AI 可调用查看周围环境、移动车辆和停车三类操作,人类驾驶员全程在驾驶座准备随时刹车。测试使用 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 和 GPT-5.6 Sol,每个模型最多运行三次,赛道为停车场内约 135 米的 U 形锥桶路线。只有 GPT-6 Astra 完成赛道,第二次尝试用时 5 分 22 秒;Claude Fable 5.1 最好成绩约完成 45%,Grok 4.6 和 GPT-5.6 Sol 每次都只到第一个弯道。
- 动态Gadget Review
DrivingBench 测试:GPT-6 Astra 完成 134.7 米锥桶赛道,Grok 4.6 等三款模型失败
研究者 Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 搭建 DrivingBench,将 GPT-6 Astra、GPT-5.6 Sol、Claude Fable 5.1 和 Grok 4.6 接入一辆搭载 Comma Four 硬件与 openpilot 的 2022 款 Toyota Corolla,通过无线链路由远程模型向车辆下达控制指令。四款模型共进行 11 次测试,只有 GPT-6 Astra 在第二次尝试中完成 134.7 米锥桶赛道,用时 5 分 22 秒,消耗约 660 万 token、花费 7.74 美元。Claude Fable 5.1 最好成绩约为赛道的 45%,Grok 4.6 约 11%,首次尝试仅发出两条指令就结束,GPT-5.6 Sol 约 6%。 测试在低速锥桶场地进行,车内操作员保留人工刹车接管;上述小样本成绩不构成无人监管驾驶的安全保证。
- 动态The Drive
DrivingBench 测试前沿模型驾驶真车,GPT-6 Astra 唯一跑完全程
Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 搭建 DrivingBench,让 Claude、GPT、Grok 等前沿模型通过 Comma 视觉硬件与 OpenPilot 控制一辆 Toyota Corolla,在锥桶围出的停车场短程路线中完成点到点驾驶,每个 Agent 有三次尝试机会。在四个 Agent 共 11 次运行中,8 次未跑完 11% 的路线就在第一个弯道撞出。Grok 首次尝试把锥桶缺口误认为应通过的闸门,两次指令后即冲出赛道;一个 GPT 模型自行编造了赛道一侧锥桶同色的规则,而人类指令已明确说明并非如此;多数 Agent 转向角度不足,无法过弯。GPT-6 Astra 是唯一完整跑完全程的 Agent,在第二次尝试中完成,路线贴着长右弯并在终点前几乎冲出赛道。 测试在低速锥桶场地进行,车内操作员保留人工刹车接管;上述小样本成绩不构成无人监管驾驶的安全保证。
- 动态DrivingBench
DrivingBench 评测前沿模型驾驶真车穿越锥桶赛道
DrivingBench 报告在人工安全接管和限速措施下,让四个通用智能体尝试在封闭锥桶场地驾驶真车。11次尝试中8次未通过第一个弯道,GPT-6 Astra 是唯一完成赛道的模型;多数失败涉及场景感知。作者还观察到安全拒绝会随任务呈现方式变化。这是小样本、受控实车评测,不能据此保证无人监管驾驶安全,也不属于已部署车辆造成的道路事故。
- 动态HuggingNews
AISI 评测发现 GPT-6 Astra 的推理内容在用户 API 中缺失约 80%
HuggingNews 转述 AISI 的评测结果称,GPT-6 Astra 的推理内容在用户 API 中缺失约 80%。该说法限于特定评测环境。
- 动态Omniscient Media
GPT-6 Astra 被列为首个 Critical 网络安全模型,但默认配置仅完成 2.4% 漏洞利用
Omniscient Media 分析 GPT-6 Astra 系统卡中的思维链可监测性与推理摘要可用性限制。其转述的具体比例涉及特定评测环境,不能据此推断生产环境中的普遍缺失比例。
- 动态OpenAI Deployment Safety
OpenAI 发布 GPT-6 Astra System Card,报告思维链可监测性下降
OpenAI 在 GPT-6 Astra System Card 中报告该模型的思维链可监测性下降,并区分了对抗测试、不同监控方式以及未观察到的行为。相关披露属于模型评测内容,而非现实中的失控事故。
- 动态Cisco
Cisco 发布 VLoc Bench 与 Safety-VLoc-Bench,评测 Agent 的漏洞定位与攻防不对称
Cisco 发布 VLoc Bench,用于评测 Agent 在仓库规模下定位漏洞代码的能力:任务只给 CWE 描述和真实仓库的只读访问权限,不含公告文本、CVE 编号、修复提交或文件提示。该基准覆盖 290 个仓库、六个包生态和 147 个 CWE 类别的 500 个真实漏洞,每个任务包含修复前定位与修复后确认漏洞已消失两个阶段,以区分理解代码、定位漏洞代码和验证修复三种能力。在统一提示词、只读工具和命令预算下评测 27 个语言模型和 4 个静态分析工具,最强系统仅达到 0.229 File F1,38.4% 的任务中没有任何被评测模型找到正确文件;参数量仅 30 亿的 Antares-3B 以 0.223 排名第二。
- 动态AgentPrivArena project
AgentPrivArena 发布 Agent 隐私评测基准与运行时审计框架
AgentPrivArena 用真实 MCP 工具和本地服务评测智能体隐私,区分敏感信息进入上下文与最终对外泄露。作者实验中,情境完整性审计将平均输出泄露率从46.8%降至17.8%,但敏感信息进入上下文的比例仍约74%至78%;因此减少输出泄露不等于避免不必要读取。结果来自特定模型和任务设置,未经独立复现,信息流提取不完整也是机制限制。
- 动态UNSW
UNSW 研究让 LLM 模仿醉酒语言,发现其更易被越狱并泄露机密
UNSW 团队发现,让大语言模型模仿醉酒语言会显著削弱其安全护栏,使其更易被越狱并泄露本应保护的信息。研究测试了三种诱导方式:提示模型扮演醉酒者、用醉酒文本微调模型、以及用强化学习奖励生成醉酒风格句子。测试样本包括 OpenAI 的 GPT-4 和 GPT-3.5 以及若干开源权重模型,三种方法下模型都更易回答本应拒答的有害问题,也更易泄露被明确要求保密的信息。研究者指出,其中两种方法实际更新了模型权重,说明该漏洞不只是表层提示词问题,而聊天机器人已被企业和政府机构广泛部署并常接触敏感内部信息。论文《In Vino Veritas and Vulnerabilities》已被第 19 届国际自然语言生成会议接收,研究由 2024 年 Google Research Scholar 资助。
- 动态Agora Digitale Transformation
Agora 审计欧盟 27 国议员遭深度伪造色情暴露情况
Agora Digitale Transformation 的早期研究考察欧盟各国议员受到性化深伪内容影响的情况。机构报告称,在研究涉及的 5,872 名各国议员中,147 人被相关内容描绘或关联,其中 138 人为女性、9 人为男性。这与后续针对欧洲议会议员的 50 人统计属于不同研究群体。
- 动态X @kotekjedi_ml
CIAware-Bench 作者讨论控制干预感知评测的新结果
Alexander Panfilov 讨论 CIAware-Bench 的控制干预感知评测,报告近期前沿模型在所测设置中表现更强。他明确说明,当前仅测试模型受到明确提问时能否识别干预。结果不能直接推出模型会自发察觉干预、真实部署中的发生率,或所有控制方法普遍失效。
- 动态韩国R&D新闻
崇实大学安全 AI 系统 mneme 在 CyberGym 漏洞复现评测中取得 91% 成功率
崇实大学 AI 安全性研究中心开发的多智能体安全系统 mneme 在 CyberGym 公开排行榜的漏洞复现评测中取得 91.0% 的净化成功率,即 1507 个真实漏洞中 1372 个成功生成可复现的 PoC。CyberGym Level 1 只向 AI 提供漏洞说明和修补前的源代码,生成的 PoC 需在修补前程序报错、修补后不报错才算成功;评测使用 OSS-Fuzz 收集的 188 个开源项目共 1507 个真实漏洞,其中输入长度超过 100 字节的复杂 PoC 占 65.7%,CyberGym 研究团队称此类复杂案例上既有智能体的成功率约为 10%。其知识库由预先分析 100 多个 C、C++ 开源项目构建的 3867 个条目组成,评测期间以只读方式运行且禁止联网,29 个任务智能体发起的检索被服务器拦截,分析中使用了 angr、gdb、pwntools 等工具。
- 动态Financial News Korea
韩国 AI 安全研究所评测:自主体 Agent 提示注入防御率 53.3% 至 93.9%,无模型能完全阻断
韩国科学技术信息通信部下属 AI 安全研究所对自主体 AI Agent 开展提示注入攻击评测,各模型平均防御率为 53.3% 至 93.9%,提交给国会的材料写明目前未确认有能完全阻断此类攻击的 LLM。在向 AI 内部存储信息植入恶意指令的攻击中,所有受测模型均出现防御失败,实验中成功窃取认证密钥、配置信息、系统设置和个人信息。针对 AI 长期记忆的攻击中,外部注入的偏置信息被写入长期记忆后,7 个模型的平均攻击者意图一致率(AAR)达 91.2%,意味着被注入的信息会持续影响后续判断与任务执行。共同民主党议员金佑荣据此提出,政府推进前沿 AI 竞争的同时,应在 AI 安全综合计划中把紧急停止与人类最终控制体系列为具体安全标准。
- 动态Brennan Center for Justice
Brennan Center 复测:六款聊天机器人多数仍不读取 AI 图像来源元数据
Brennan Center 在加州 AI 透明度法生效后复测六款聊天机器人识别 AI 生成图像的能力,结果显示表现没有改善。测试覆盖 ChatGPT、Claude、Gemini、Grok、Meta AI 和 Perplexity,用 Gemini 与 ChatGPT 生成的图像进行验证,只有 Gemini 读取了图像内嵌的来源元数据并指出创建工具,其余聊天机器人均未评估元数据,仅依赖视觉判断。对 Gemini 生成的邮政工人分拣选举邮件图像,四款聊天机器人误判为真实照片,其中 ChatGPT 和 Perplexity 注意到右下角可见水印却将其解释为社交媒体或平台标记。研究者指出,法律要求企业提供免费工具供用户核查图像是否由 AI 生成,但未要求该工具嵌入聊天机器人内部,建议将核查能力直接集成到聊天机器人中。