大模型开车实测:成功但龟速烧钱,何时能上路?
数码新声
一、实测:一次足尺的真车“路考”
实验设计:三位研究员用一辆丰田卡罗拉、一台Comma 4设备通过OBD-C线连接CAN总线,让大语言模型在原生聊天应用中直接下发驾驶指令,在湾区停车场用锥形桶布置了总长134.7米、含多次转弯与直道的路线。
测试结果:GPT-6 Astra在第二次尝试时100%完成全程,耗时5分22秒,共发出24条命令;Claude Fable 5.1的最好成绩为45%;Grok 4.6三次尝试分别只前进8%、11%、10%,基本在第一个弯道就失败。
直观体感:成功完成全程的GPT-6 Astra平均车速仅0.42米/秒,相当于人类步行的速度,全程消耗约7.74美元的Token费用。
二、瓶颈:延迟、成本与安全三座大山
延迟过高:模型每条指令都要经过“模型→MCP服务器→网关→Comma→openpilot”的闭环通信,每次决策都伴随明显时延,难以应对真实道路的动态变化。
成本高昂:跑完134米就烧掉7.74美元Token,若折算到真实通勤里程,单次出行的计算成本将远超车辆本身价值。
安全验证缺位:现有自动驾驶安全体系面向专用感知-决策系统设计,通用大模型的黑箱推理机制无法满足车规级安全认证要求。
三、结论:能“摸方向盘”,但远不能上路
实验室价值:DrivingBench首次证明通用大模型能同时处理感知、规划、控制与物理反馈,具备端到端驾驶的初步闭环能力。
现实距离:受限于延迟、成本与安全验证,通用聊天模型直接量产驾驶不具可行性,当下自动驾驶量产方案仍以专用VLA(视觉-语言-动作模型)为核心。