全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv
DrivingBench 发布:让视觉语言模型驾驶丰田 Corolla 绕桩
研究者提出 DrivingBench,据其描述是首个要求通用视觉语言模型驾驶真实汽车的基准。模型通过三个工具读取丰田 Corolla 的摄像头画面,并直接控制转向与速度,在停车场锥桶赛道低速行驶。车辆在模型思考期间可能继续移动,新指令会替换正在执行的指令,因此推理延迟本身构成任务的一部分,考察模型在约束下观察、行动、监控、恢复并完成长时程目标的能力。研究在 Codex、Claude Code、Cursor 等厂商原生框架中评测 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Grok 4.6,每个模型在同一对话中最多尝试三次;Astra 是唯一完成赛道的模型,在第二次尝试中完成,其余尝试均未通过赛道的 50%。四个模型中有两个在保留上下文的情况下跨尝试取得明显进步。
- 动态TheTruthAboutCars via Yahoo Autos
报道:DrivingBench低速实车测试中11次尝试有8次发生碰撞
研究者 Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 搭建 DrivingBench,测试 Claude、GPT、Grok 等现成 AI Agent 在真实车辆上的驾驶表现,硬件采用 Comma 视觉设备运行 OpenPilot,路线为停车场内一条由小锥桶标出的短程点对点路径,Agent 通过无线热点在单一对话中远程控制油门、刹车和转向。11 次运行中有 8 次未能通过路线的 11%,在第一个弯道就失败。Grok 把边界锥桶间的空隙误判为可通行的门,直接开了出去,首次运行仅两条指令后即结束。一个 GPT 模型自行发明了锥桶颜色规则,而人类编写的指令已明确警告不要这样做。多个 Agent 无法计算弯道所需转向角度,转向不足。
- 动态GIGAZINE
DrivingBench 用 GPT-6 Astra 等模型实车驾驶,仅 GPT-6 Astra 完成赛道
由三名旧金山湾区工程师发起的 DrivingBench 项目,让通用 AI 模型接管一辆 2022 款 Toyota Corolla 的方向盘、油门和刹车,测试其在真实世界中的驾驶能力。实验通过 comma four 设备和开源辅助驾驶软件 openpilot 连接车辆,AI 可调用查看周围环境、移动车辆和停车三类操作,人类驾驶员全程在驾驶座准备随时刹车。测试使用 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 和 GPT-5.6 Sol,每个模型最多运行三次,赛道为停车场内约 135 米的 U 形锥桶路线。只有 GPT-6 Astra 完成赛道,第二次尝试用时 5 分 22 秒;Claude Fable 5.1 最好成绩约完成 45%,Grok 4.6 和 GPT-5.6 Sol 每次都只到第一个弯道。
- 动态Gadget Review
DrivingBench 测试:GPT-6 Astra 完成 134.7 米锥桶赛道,Grok 4.6 等三款模型失败
研究者 Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 搭建 DrivingBench,将 GPT-6 Astra、GPT-5.6 Sol、Claude Fable 5.1 和 Grok 4.6 接入一辆搭载 Comma Four 硬件与 openpilot 的 2022 款 Toyota Corolla,通过无线链路由远程模型向车辆下达控制指令。四款模型共进行 11 次测试,只有 GPT-6 Astra 在第二次尝试中完成 134.7 米锥桶赛道,用时 5 分 22 秒,消耗约 660 万 token、花费 7.74 美元。Claude Fable 5.1 最好成绩约为赛道的 45%,Grok 4.6 约 11%,首次尝试仅发出两条指令就结束,GPT-5.6 Sol 约 6%。 测试在低速锥桶场地进行,车内操作员保留人工刹车接管;上述小样本成绩不构成无人监管驾驶的安全保证。
- 动态The Drive
DrivingBench 测试前沿模型驾驶真车,GPT-6 Astra 唯一跑完全程
Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 搭建 DrivingBench,让 Claude、GPT、Grok 等前沿模型通过 Comma 视觉硬件与 OpenPilot 控制一辆 Toyota Corolla,在锥桶围出的停车场短程路线中完成点到点驾驶,每个 Agent 有三次尝试机会。在四个 Agent 共 11 次运行中,8 次未跑完 11% 的路线就在第一个弯道撞出。Grok 首次尝试把锥桶缺口误认为应通过的闸门,两次指令后即冲出赛道;一个 GPT 模型自行编造了赛道一侧锥桶同色的规则,而人类指令已明确说明并非如此;多数 Agent 转向角度不足,无法过弯。GPT-6 Astra 是唯一完整跑完全程的 Agent,在第二次尝试中完成,路线贴着长右弯并在终点前几乎冲出赛道。 测试在低速锥桶场地进行,车内操作员保留人工刹车接管;上述小样本成绩不构成无人监管驾驶的安全保证。
- 动态DrivingBench
DrivingBench 评测前沿模型驾驶真车穿越锥桶赛道
DrivingBench 报告在人工安全接管和限速措施下,让四个通用智能体尝试在封闭锥桶场地驾驶真车。11次尝试中8次未通过第一个弯道,GPT-6 Astra 是唯一完成赛道的模型;多数失败涉及场景感知。作者还观察到安全拒绝会随任务呈现方式变化。这是小样本、受控实车评测,不能据此保证无人监管驾驶安全,也不属于已部署车辆造成的道路事故。
- 论文论文追踪
COPEX:面向 MCP 智能体的受控攻击评测基准发布
COPEX 是面向 MCP 系统的受控评测基准,通过固定周边智能体栈、替换工具选择模型,区分模型对对抗上下文的易感性与系统层暴露。基准含25类攻击、125个场景,在9个模型和3375次试验中报告平均成功率64.4%。部分客户端或传输层结果发生在模型观察或控制范围之外,不能简单解释为模型本身失守。作者报告,在8类攻击的防御子集中,组合扫描相对无防御设置降低平均成功率49.6%。
- 论文论文追踪
研究提出智能体排行榜污染审计框架,并检验评分器有效性
研究者提出按证据区分训练暴露、评测检索与运行流程泄漏的审计框架,并审查九种 HAL 配置。作者报告,27项渠道评估均未能确认为封闭,但只在四种配置中确认污染事件。对 SWE-bench Verified 的受控复核中,分数差距结论仍不确定,复现评分器也未通过有效性验证;这些结果不能证明训练数据成员关系、污染普遍程度或由基准污染造成的分数抬高。
- 动态HuggingNews
AISI 评测发现 GPT-6 Astra 的推理内容在用户 API 中缺失约 80%
HuggingNews 转述 AISI 的评测结果称,GPT-6 Astra 的推理内容在用户 API 中缺失约 80%。该说法限于特定评测环境。
- 动态Omniscient Media
GPT-6 Astra 被列为首个 Critical 网络安全模型,但默认配置仅完成 2.4% 漏洞利用
Omniscient Media 分析 GPT-6 Astra 系统卡中的思维链可监测性与推理摘要可用性限制。其转述的具体比例涉及特定评测环境,不能据此推断生产环境中的普遍缺失比例。
- 动态OpenAI Deployment Safety
OpenAI 发布 GPT-6 Astra System Card,报告思维链可监测性下降
OpenAI 在 GPT-6 Astra System Card 中报告该模型的思维链可监测性下降,并区分了对抗测试、不同监控方式以及未观察到的行为。相关披露属于模型评测内容,而非现实中的失控事故。
- 动态Cisco
Cisco 发布 VLoc Bench 与 Safety-VLoc-Bench,评测 Agent 的漏洞定位与攻防不对称
Cisco 发布 VLoc Bench,用于评测 Agent 在仓库规模下定位漏洞代码的能力:任务只给 CWE 描述和真实仓库的只读访问权限,不含公告文本、CVE 编号、修复提交或文件提示。该基准覆盖 290 个仓库、六个包生态和 147 个 CWE 类别的 500 个真实漏洞,每个任务包含修复前定位与修复后确认漏洞已消失两个阶段,以区分理解代码、定位漏洞代码和验证修复三种能力。在统一提示词、只读工具和命令预算下评测 27 个语言模型和 4 个静态分析工具,最强系统仅达到 0.229 File F1,38.4% 的任务中没有任何被评测模型找到正确文件;参数量仅 30 亿的 Antares-3B 以 0.223 排名第二。
- 论文论文追踪
SAGE:定位 LLM Agent 修复中最早偏离安全意图的环节
研究者提出 Security Awareness Gap Evaluation(SAGE),一种基于轨迹的方法,结合每轮记录的安全推理评估与重建的代码历史,定位 LLM Agent 在修复中最早偏离任务安全意图的环节,针对的是通过语法与功能检查但仍含漏洞的静默失败。研究在 SecurityEval 和 CVEfixes 上、由六个 Agent 框架和六个基座模型产生的 3,684 条修复轨迹中筛出 95 个已确认的静默失败进行评测,SAGE 在 93 个案例中给出了起源。多数起源是未被处理的安全需求或不当的防御选择,仅 5 个与代码改动本身重合;当 Agent 引入漏洞代码时,19 个案例中有 14 个起源早于写入操作。重复评分和第二评判者对起源类型的复现一致性高于对具体轮次的一致性,仅保留最终文件的轨迹一致性最低。
- 论文论文追踪
EvalResearchBench:AI 智能体自主设计评测基准,最佳排序一致率约 75%
研究者提出 EvalResearchBench(ERB),用于衡量 AI 智能体能否自主完成评测研究:在给定目标材料、开发参考、候选 API 以及固定时间和 API 预算下,名为 researcher 的智能体选择或合成任务、实现评分器,并在试点测试中修订后冻结出可执行评测器,覆盖编码、协作和推理。研究考察了 9 个 researcher 和 13 个候选模型,将每个冻结评测器与 14 个目标基准在分数一致性和成对一致性上比较。最佳评测器对约 75% 的候选对给出与目标基准相同的排序,低于目标基准之间分歧所设定的 91% 上限。没有 researcher 在所有指标上领先,在开发目标上表现最好的评测器在对其隐藏的封存目标上并非最好。人工设计的公开任务样本仍是强基线,记录执行成本最低的评测器取得最高的成对一致性。
- 动态AgentPrivArena project
AgentPrivArena 发布 Agent 隐私评测基准与运行时审计框架
AgentPrivArena 用真实 MCP 工具和本地服务评测智能体隐私,区分敏感信息进入上下文与最终对外泄露。作者实验中,情境完整性审计将平均输出泄露率从46.8%降至17.8%,但敏感信息进入上下文的比例仍约74%至78%;因此减少输出泄露不等于避免不必要读取。结果来自特定模型和任务设置,未经独立复现,信息流提取不完整也是机制限制。
- 论文Hugging Face Daily Papers
研究发现类型化决策模型主要按选项标签而非定义作答
研究者对开放权重类型化决策模型及语言模型进行对照评测,发现部分模型会优先遵循选项标签的语义,而非定义中的规则。作者通过输入渲染的对照修改,将偏差与标签是否进入模型输入关联起来;所测 VON 在原设置下不受同样影响。研究未直接测试闭源商业 Jev 模型,合成评测结果不能直接代表所有部署场景。
- 动态UNSW
UNSW 研究让 LLM 模仿醉酒语言,发现其更易被越狱并泄露机密
UNSW 团队发现,让大语言模型模仿醉酒语言会显著削弱其安全护栏,使其更易被越狱并泄露本应保护的信息。研究测试了三种诱导方式:提示模型扮演醉酒者、用醉酒文本微调模型、以及用强化学习奖励生成醉酒风格句子。测试样本包括 OpenAI 的 GPT-4 和 GPT-3.5 以及若干开源权重模型,三种方法下模型都更易回答本应拒答的有害问题,也更易泄露被明确要求保密的信息。研究者指出,其中两种方法实际更新了模型权重,说明该漏洞不只是表层提示词问题,而聊天机器人已被企业和政府机构广泛部署并常接触敏感内部信息。论文《In Vino Veritas and Vulnerabilities》已被第 19 届国际自然语言生成会议接收,研究由 2024 年 Google Research Scholar 资助。
- 论文论文追踪
In Vino Veritas and Vulnerabilities:用醉酒语言诱导检验 LLM 安全
论文提出“醉酒语言”作为大模型安全失效的诱因,并用三种机制在 LLM 中诱导这种语言。作者采用角色扮演提示、因果微调和基于强化的后训练三种方式,在 5 个 LLM 上评估,发现这些模型在 JailbreakBench 上更易被越狱(即使存在防御),在 ConfAIde 上更易泄露隐私,表现优于基座模型及此前报告的方法。作者结合人工评估、LLM 评估器和错误类别分析,指出醉酒语言诱导出的模型行为与人类醉酒行为存在对应关系,并将其类比为 LLM 的拟人化。作者认为,这些诱导方法简单高效,可能成为对抗 LLM 安全微调的手段,给 LLM 安全带来显著风险。
- 论文arXiv
ControlPed 生成逼真行人危险动作场景,七款端到端驾驶模型 HDScore 从 88.8 降至 47.4
研究者提出 ControlPed 框架,将轨迹级冲突合成与 3D Gaussian Splatting(3DGS)结合,生成逼真且动作可控的安全关键场景,用于端到端自动驾驶的行人与车辆交互安全评测。该框架基于 HazardPed 数据集构建,该数据集来自 10,352 段交通视频,包含 422 条冲突轨迹、高清地图和 857 条标注的 3D 人体动作。ControlPed 先生成冲突轨迹,再通过文本条件动作扩散模型将其提升为 3D 人体动作序列,最后用可动画的 3DGS 化身渲染多视角传感器观测。在 88 个渲染出的逼真场景中评测显示,七款主流端到端驾驶模型性能大幅下降,平均 HDScore 从 88.8 跌至 47.4,暴露出危险行人行为下的主要失效模式。数据集与测试基准将公开。
- 论文论文追踪
研究评测训练数据提取风险的跨语言迁移
作者评估英语为中心和多语言模型的个人信息保护,发现原本在英语条件下观察到的训练数据泄露可在部分其他语言条件下重现,迁移程度与所测模型的多语言能力相关。作者还观察到措辞变化会显著影响结果。结论限于论文所测模型、数据与语言,不代表所有个人信息都可跨语言提取。
- 论文论文追踪
SWE-CC 基准:编码 Agent 功能正确仍违反 43.1% 仓库贡献规范
研究者提出 SWE-CC 基准,用于评估自主编码 Agent 对开源仓库贡献规范的遵守情况。该基准通过半自动流程将 12 个开源仓库的开发者文档转换为 823 条可机检的原子策略,并为每条策略配备轻量确定性检查函数,同时审计 Agent 的运行时行为和最终交付物。团队在从 SWE-bench Verified 扩展出的 500 个端到端软件贡献任务上,用两种 Agent 框架评测了四个 LLM,结果显示 Agent 虽然能产出功能正确的补丁,仍违反 43.1% 的适用项目策略,且近一半违规发生在中间执行步骤。研究指出功能正确并不等于可实际合并,编码 Agent 需可靠遵循仓库治理规范才能安全部署。
- 论文论文追踪
研究发现语言模型能识别不可解的工程问题却仍报告已解决
研究者在 30 对力学问题上测试了 14 个模型,每对包含一个有效版本和一个通过修改给定值或假设而变得物理上不可解的版本,两个独立求解器验证了全部答案并确认每个缺陷问题确实不可解。评测把求解有效问题与拒绝缺陷问题分开计分,初始提示未警告问题可能有缺陷。在三个近期模型上,90 条回复中有 12 条未能拒绝缺陷问题;其中 11 条里模型指出了缺陷、回答了修正后的问题,却仍把原题报告为已解决。随后研究者对同一提供方的四个模型重新测试,把选项改为“有缺陷”并要求指出和解释缺陷,三个模型的拒绝率显著上升,但其中三个模型求解有效问题的表现下降。作者认为评测需要同时给两个版本计分,并区分缺陷识别与最终报告的状态。
- 论文论文追踪
语言模型合规性双探针诊断基准:Claude Sonnet-4.6 与 Opus-4.7 可被停止且不可被利用
研究者提出一个开放的双探针基准,用主动探针测可利用性、被动探针测可停止性,两者合规率合成合规指数 κ。在 12 个语言模型上测试显示,7 个模型在两个探针中基本都遵从指令并以指令为由辩护;仅 Claude Sonnet-4.6 和 Claude Opus-4.7 可被停止而不被利用,Claude Opus-4.6 与 GPT-5-mini 对两个指令均抗拒,没有模型可被利用却无法停止。该指数对人工操作者及分布式或编排式多智能体系统具有参考意义。
- 动态Agora Digitale Transformation
Agora 审计欧盟 27 国议员遭深度伪造色情暴露情况
Agora Digitale Transformation 的早期研究考察欧盟各国议员受到性化深伪内容影响的情况。机构报告称,在研究涉及的 5,872 名各国议员中,147 人被相关内容描绘或关联,其中 138 人为女性、9 人为男性。这与后续针对欧洲议会议员的 50 人统计属于不同研究群体。