今年,英伟达 Alpamayo Summit 的第二场分论坛,讲的是整个开放生态的核心——推理模型本身。主讲人 Yurong You 是英伟达自动驾驶研究组的高级研究科学家,Alpamayo 模型的主要作者之一。这次演讲他分享了英伟达Alpamayo 模型和训练配方。
也透露了几个是自动驾驶算法特别关心的话题:
对扩散动作专家单独做一轮 RL 之后,闭环仿真得分的提升4.7%
把推理从文本搬进潜空间之后的推理加速2 到 4 倍
同一个决策,文本推理用的 token 数和潜空间推理用的 token 数从90 降低到 38、
跑 Alpamayo 1.5 推理的显存门槛只需要24 GB
今夏发布的 Alpamayo 2 Super 参数量是32B
更重要的是在训练过程中,英伟达发现现在模型在越难的场景里出现得越频繁的反思。You 展示的一篇 CVPR 论文里,模型先提出"加速通过环岛",然后自己停下来——"等等,如果那个行人继续往前走,现在加速会撞上"——改成减速等待。总结为:Alpamayo 这一代的重点不是"让车会说话",而是"让车在说话的过程中修正自己"——推理从一种可解释性的装饰,变成了改善动作质量的机制。当然实现这一点靠的不是更大的模型,是一套精心设计的、可以下载的 RL 后训练配方。
所以,本文按当时的演讲章节,每一章先把 PPT 和演讲原话里的信息讲清楚,再从行业学习和点评的角度给出看法。来分享英伟达最新模型的架构,训练方式,希望给自动驾驶和人形机器人落地提供一些信息和启发。

标题页:Yurong You,NVIDIA 自动驾驶研究组高级研究科学家,Alpamayo Summit,2026 年 6 月 4 日
一、先把架构摆出来:推理层和动作层是两套东西
议程:Alpamayo 模型与配方概览;Alpamayo 1.5 演示;SFT/RL 配方
You 的开场只有一句话:驾驶一辆车需要的不只是感知和轨迹预测,要找一种"能规模化、能泛化地解决长尾"的范式。然后他回顾了 Marco Pavone 开场时讲过的架构图。

三层架构。
动作层:推理引导的轨迹扩散,轻量条件流匹配解码,RL 后训练对齐推理与动作。
推理层:互联网预训练的 Cosmos-Reason 骨干,用可验证奖励的 RL 改善因果推理。
视觉层:多相机多时间步 token 化。输入:多相机图像、用户指令、导航、自车历史。训练信号:IL、SFT、RL
Alpamayo 是一个把推理和动作预测连在一起的 VLA,专为自动驾驶设计。它不是标准 VLA——标准 VLA 把视觉和文本直接映射成动作;推理型 VLA 把任务拆开,先对场景推理,再输出轨迹。输入是多相机、多时间步的图像,加上文本形式的用户指令和导航;输出三样:推理轨迹、元动作、轨迹。You 说这条路线既可扩展又可泛化,动作预测明显更好,还多了一样东西:"我们有办法内省模型到底在想什么,这给了安全监控一条路。"
Vehicle 点评
第一,这张架构图上最重要的信息是三个训练信号并列:IL、SFT、RL。
这三个都是训练自动驾驶(以及大模型)时给模型"学习信号"的方式,区别在于信号从哪来、模型怎么被纠正。
IL — Imitation Learning,模仿学习 让模型看人类专家的驾驶记录(传感器输入 → 专家的轨迹/动作),学着输出一样的东西。信号就是"专家在这一刻做了什么",模型照抄。自动驾驶里最常见的是行为克隆(Behavior Cloning),Alpamayo 的预训练基本就是这个。优点是数据现成、训练稳定;缺点是 Igl 那场讲的两条:专家数据里没有错误,模型学不会从自己的偏差里恢复(协变量偏移);也分不清是因为红灯停还是因为前车停(因果混淆)。
SFT — Supervised Fine-Tuning,监督微调 在已经预训练好的模型上,用一批精心标注的"输入 → 标准答案"数据再训一轮,信号是人工或高质量模型给出的标签。它和 IL 在数学上是一回事(都是监督学习),区别在用法:IL 通常指从零学动作,SFT 指对一个已有大模型做定向校正。Alpamayo 里的 SFT 数据是人工写的推理链("前方有行人横穿,所以减速")配上轨迹,教模型先说理由再给动作。推理模型那场提到的"闭环监督训练"(RoAD)也属于这一类——在仿真里跑偏,专家模型给修正轨迹,把这些配对当 SFT 数据。
RL — Reinforcement Learning,强化学习 不给标准答案,只给一个分数(奖励)。模型自己产出动作,环境或评分器告诉它好不好,它朝着高分方向调整。信号是"结果的好坏",而不是"正确答案是什么"。这是唯一能教模型从错误中恢复、学到因果的方式,因为它必须自己试。英伟达将其分成两种:
开环 RL:输入还是数据集里固定的一帧,模型出一条轨迹,评分器打分(比如和专家轨迹的偏差、推理链是否自洽),不和仿真器交互。便宜,Yurong You 那场讲的是这个。
闭环 RL:模型开进 AlpaSim 仿真器,跑一整段,按实际发生的碰撞、进度、舒适度打分。贵得多(一条 rollout 几个 GB),但信号最真实,AlpaGym 就是为它建的。
三者在 Alpamayo 训练流水线里的顺序是:IL 预训练打底 → SFT 教它推理格式 → RL(先开环后闭环)修正行为。这和 LLM 的"预训练 → SFT → RLHF"是同一套配方,只是把"文本"换成了"轨迹",把"人类偏好"换成了"仿真里有没有撞车"。
国内多数端到端方案只有第一个——模仿学习。英伟达的架构从设计之初就为后两个留了位置:SFT 教模型"怎么想",RL 教模型"想得对不对"。没有 SFT 和 RL 的端到端模型,本质上是一个更大的模仿学习器,长尾问题不会因为参数量变大而消失。
第二,"内省"作为安全监控的路径,是国内 L3 合规讨论里缺的一环。国内谈安全监控,通常指规则层的兜底和冗余感知。英伟达把"读模型的推理轨迹"当成一种监控手段——如果推理说"前方无车"而感知说有车,这就是一个可以触发降级的信号。这条路不一定成熟,但它给"可解释性"找到了一个工程用途,而不只是产品宣传。
二、推理不止一种形式:从因果链到潜空间
推理轨迹的多种表示,都为了"像人一样推理"。结构:思维链、因果链、反事实推理(动作→反思→动作→反思)。模态:多模态推理(思维→图像)、潜空间推理(潜思维→潜思维)。左图:路边行人与横穿的小动物
Alpamayo 目前用纯英文的因果链做推理——模型列出因果关系。但 You 说推理不必局限于此,他把选项摆成一张表。按结构分:思维链、因果链、反事实推理。按模态分:多模态推理、潜空间推理。
他重点解释了反事实:驾驶中部分可观测是常态。图里一只猫或兔子横穿马路,路边的行人可能跟着跑出来,也可能不。如果车能先假设一个动作、反思它的后果、再据此行动,会好得多。"这不是线性过程,是来回往复。"至于模态:人可以用视觉推理,也可以完全在脑子里——潜空间里——推理,不需要说出来。

反事实推理在困难场景里自适应发生并降低轨迹误差。左:横轴场景由易到难(跟车 → 变道),柱状为思考率,折线为反事实推理前后的轨迹误差。右例:系统先提"0–1.3 s 保持、1.3–6.4 s 加速",反思"行人可能横穿,减速等待更安全",修正为"0–5.0 s 减速、5.0–6.4 s 等待"。CVPR 2026
反事实推理是英伟达今年 CVPR 的论文。右侧例子:行人可能走到车前,系统最初提议"加速",然后自我反思——"等等,现在加速、如果行人决定继续往前走,会撞上,让我调整"——改成减速等待。发现有两个:反事实推理在困难场景里自适应地出现——横轴场景越难,发生率越高;而且越难的场景里做了反事实推理,结果越好。You 强调:"这不是我们显式编程的,是模型的涌现行为。"

潜空间思维链。上:文本推理约 90 token;下:潜空间推理约 38 token,潜世界模型与动作交替。文本因果链的局限:长序列推理慢、时空表征弱、动作-文本对齐弱。潜空间优势:推理快 2–4 倍、轨迹质量更好、更适合 RL 后训练。CVPR 2026
潜空间推理同样是今年英伟达的 CVPR论文。不用文本推理轨迹,而是用潜变量表示周围的世界模型,思考什么动作会引起状态怎样变化。PPT 上的对比很直观:同一个决策,文本推理 90 个 token,潜空间 38 个。结果:推理快 2 到 4 倍,轨迹质量更好,而且因为是连续空间,更适合 RL 后训练。
Vehicle 点评
第一,"反思是涌现的"这句话,是这场演讲对国内 VLA 团队最有用的一个信号。它意味着你不需要手写"什么时候该反思"的规则,只需要在训练数据里包含反思的样本,模型会自己学到在难的场景里多想一步。这把"长尾处理"从规则工程变成了数据工程。国内团队应该检查自己的推理标注里有没有"先提议、再否定、再修正"这种结构——如果没有,模型学不会反思。
第二,潜空间推理解决的是国内车端团队最关心的问题:延迟。文本推理在车端的致命问题是要逐 token 生成,90 个 token 在车规芯片上是几百毫秒。潜空间推理把 token 数减半、还不需要解码成文字。但它也让"可解释性"打了折——潜空间里的思维人读不懂。英伟达的解法大概是云端用文本推理(可读、可标注、可评估),车端用潜空间推理(快),两者用蒸馏连接。国内团队如果同时要"可解释"和"低延迟",应该正视这两个目标之间的张力。
三、五个阶段:一个推理模型是怎么练出来的
五阶段:VLM 训练(Cosmos-Reason2,通用世界知识)→ 预训练(驾驶数据,注入动作模态)→ SFT(推理轨迹,推理冷启动)→ RL 后训练(开环 RL;闭环 RL "即将推出")→ 蒸馏与量化(车端部署)
这是整场演讲的骨架图。VLM 训练直接用 Cosmos Reason 骨干,它已经在大规模互联网数据上预训练过,带来通用世界知识。预训练在驾驶数据上预训练一轮,处理常规驾驶。You 说这一步的本质是把动作模态注入模型——让模型知道动作长什么样、怎么和环境交互。SFT用自动标注流水线产出的推理轨迹做监督微调,激发推理。他的说法是"用 CoT 冷启动模型,教它想什么、怎么想"。RL 后训练进一步提升推理能力和轨迹对齐。蒸馏与量化把全部能力带到边缘设备。
然后是这场演讲的核心论断:"Alpamayo 1.5 最大的收益来自把后训练规模化。"在 10B 模型上——它是作为通用教师用的——推理质量和轨迹-推理对齐都有显著提升。下一步是闭环 RL,正在搭建,这次 CVPR 发布的 AlpaGym 就是为它准备的。
Vehicle 点评
第一,"预训练是注入动作模态,SFT 是冷启动推理"——这两句定义值得国内团队抄在墙上。它们回答了一个常见的困惑:一个语言模型凭什么会开车?答案是分两步:先让它见过足够多的"图像→轨迹"对,知道动作是什么;再让它见过足够多的"图像→推理→轨迹"三元组,知道怎么想。跳过第一步直接做 SFT,模型学的是"编一段合理的话"而不是"开车"。
第二,"最大收益来自后训练"这个结论,对国内算力预算的分配方式是一个挑战。国内团队的算力大多花在预训练和数据规模上,后训练被当成收尾。英伟达从 Alpamayo 1 到 1.5 的主要提升不是换骨干、不是加数据,是把 RL 后训练做大做深。这意味着同样的算力,花在后训练上的边际收益可能更高——前提是你有奖励设计和 RL 基础设施的能力。
四、把 RL 做大:三个轴、64 倍、4.7%
You 用三张 PPT 讲了 Alpamayo 1.5 的 RL 后训练是怎么规模化的。三个缩放轴:学习规模、任务广度、RL 课程。

左:三个缩放轴——学习规模、任务广度、RL 课程。右上:异步基础设施——Rollout Worker 执行策略,Policy Trainer 更新策略,Orchestrator 协调;权重走 NCCL,协调走 Redis,负载走 HTTP。右下:每步学习经验从 64 到 4096,64 倍吞吐只多 3 倍时间
学习规模从 Alpamayo 1 学到的一课:模型能力强烈取决于训练中可用的学习经验量。为此在开源的 Cosmos-RL 框架上搭了一套异步 actor-learner 基础设施——一组 rollout worker 不停地跑当前模型、收集推理轨迹和轨迹预测;另一组模型副本从中学习;自生成的数据被评估、打分、作为 RL 信号反馈回去;中央控制器协调两组。结果:每步超过 4,000 条经验,学习吞吐提高 64 倍,每步训练时间只多 3 倍。

任务广度:RL 在推理、规划、grounding 基准上全面提升。六项对比(After RL vs Base model):驾驶推理得分 +9.8%、轨迹 ADE 18.9%、轨迹舒适度 +5.4%、Lingo-QA +4.5%、车道跟随 22.4%、导航条件 ADE 2.1%
任务广度Alpamayo 在演变成一个能力集不断增长的驾驶基础模型,RL 也得跟上。1.5 扩展了奖励信号,强化四种能力:推理、驾驶专属问答、grounding、轨迹规划。You 的说法是:"精心设计能提供有意义学习信号的奖励模型之后,RL 现在能在不同任务上广泛提升 Alpamayo。"PPT 上六个指标全部改善,轨迹误差降了近 19%,车道跟随误差降了 22%。

RL 课程:交错 SFT → RL。阶段一对自回归 VLM 做 RL;阶段二冻结 VLM,对扩散动作专家先 SFT 再 RL。"RL 信号贯穿整个模型栈"。右下:AlpaSim 闭环得分——基线 0 → 动作专家 SFT +1.2% → 动作专家 RL +4.7%
课程模型有两部分——VLM 和动作专家——RL 得适配这个结构。做法是交错:先在 VLM 上做一轮 RL;然后冻结 VLM,训练动作专家;再对动作专家单独做一轮 RL。PPT 右下角的柱状图是这一章最硬的数据:AlpaSim 闭环得分,动作专家只做 SFT 提升 1.2%,再做 RL 提升到 4.7%。"RL 信号贯穿整个模型栈。"
Vehicle 点评
第一,"64 倍吞吐、3 倍时间"这组数字背后是基础设施,不是算法。异步 rollout、Redis 协调、NCCL 传权重——这些是 LLM 训练基础设施的标配,英伟达把它们搬到了自动驾驶 RL 上。国内多数自动驾驶团队还没有讲过这套东西。RL 后训练要规模化,第一件事不是设计奖励,是搭一个能每步跑 4,000 条 rollout 的系统。这是一个组织能力问题:自动驾驶团队和大模型基础设施团队要么合并,要么深度协作。
第二,"冻结 VLM、单独训动作专家、+4.7%"是可以直接复制的实验结论。它说明推理头和动作头的 RL 应该分开做、分阶段做——一起做会互相干扰。国内团队如果已经有了推理 VLA,下一步最便宜的提升就是照这个课程走一遍。我们之前文章《自动驾驶算法的 DeepSeek 时刻:阿里开源的Qwen-Drive?》分享的Qwen-Drive在训练时候也采用冻住某个模块训其他的方法,所以这种方法应该会在量产中快速应用。
第三,六个指标里"车道跟随 22.4%"最值得国内团队注意。车道跟随是最基础的驾驶能力,一个推理模型在这上面还有 22% 的改善空间,说明 SFT 之后的模型在基本功上并不实——它学会了"说",但"做"还差得远。RL 补的正是这一块。
五、Alpamayo 1.5 和一台 H100 上的现场演示
Alpamayo 1.5:灵活传感器配置。四项能力:RL 后训练、导航引导、交互式问答、场景 grounding。LingoQA 自动驾驶推理第 1;Hugging Face 下载量第 2 的机器人模型
Alpamayo 自今年 CES 起获得强劲关注,GTC 发布的 1.5 新增了导航引导和 VQA 两项能力,在 LingoQA 自动驾驶推理榜上排第一,是 Hugging Face 上下载量第二的机器人模型。然后 You 切到终端。

演示范围:数据长什么样;带导航引导的因果链推理;VQA;检查输出。要求:Python 3.12、GPU ≥24 GB 显存(RTX 3090/4090、A5000、H100)、Linux
环境是一台 H100(80 GB)服务器,但 PPT 上写明24 GB 显存的消费级显卡就能跑。他提前下好了模型和一段物理 AI 数据集的片段。

输入网格:四个时间步(t = 0.3 到 0.0 秒)× 三路相机(左交叉、前广角、右交叉),夜间雪地
输入两类:图像和轨迹。自车历史用过去 1.5 秒。图像每路相机取 0、0.1、0.2、0.3 秒四帧,相机是左交叉、前广角、右交叉、前长焦。token 序列 = 系统提示 + 逐相机逐帧的占位 token(过图像编码器后替换为嵌入)+ 轨迹历史 token;然后让模型输出驾驶过程的思维链,再输出未来轨迹。

导航"30 米后右转"的鸟瞰轨迹分布:蓝色为右转导航、绿色为反事实的左转导航、红色为无导航,黑色为真值。无导航时模型输出是多模态的
导航引导1.5 的新能力:像 Google 地图一样告诉模型"30 米后右转"。token 里只多了 route start / turn right in 30 m / route end,其余不变。他还试了反事实的导航——把左右互换。因为动作生成用的是流匹配的动作专家,可以用 CFG(classifier-free guidance)放大导航信号。结果图很直观:蓝色(右转)和绿色(左转)分开了,红色(无导航)散成多个模态。加大 CFG 后转向更明显。

VQA 笔记本:question = "Describe the scene.",构造多轮消息、应用对话模板,序列长度 1791。同一模型、同一数据、不同任务
VQA同一个模型,同一段数据,这次不出轨迹,而是问问题。场景是一个施工区。问"描述这个场景",模型答:这是一个用锥桶围出的作业区,作业车辆和工人占了我们车道右侧,后方有车接近,我们应该减速。再问"关键交通元素有哪些、应该如何影响驾驶",模型列出施工元素、锥桶、工人。两个笔记本都在 GitHub 上。
Vehicle 点评
第一,导航引导的实现方式——三个 token——说明了"可引导"的本质是训练数据里有对应的样本。模型不是理解了"右转"的语义,是见过足够多"route start / turn right / route end + 对应轨迹"的配对。这也解释了问答环节里 Honda 研究员的抱怨:说"100 米后右转"模型会忽略,因为它看不到 100 米外——训练数据里没有这种样本。这种方式其实在国内量产也开始落地,在和地平线HSD交流过程中,地平线HSD已经将原本人类导航理解的指令输入到自动驾驶算法中增加系统对导航的理解,也给其他国内团队做导航条件的 VLA 时一些启发,导航指令的距离分布应该和实际使用场景匹配,不能只标"下个路口"。
第二,VQA 演示里那句"后方有车接近,我们应该减速"值得注意。模型在描述场景时自动加上了行动建议——这是 SFT 数据格式带来的习惯:因果链标签的格式就是"观察 → 判断 → 建议"。国内团队如果用自己的标注格式训练,输出风格也会跟着变。标注格式定义了模型说话的方式。
六、配方、常见问题、和 Alpamayo 2 Super
今天可用:Alpamayo 1 与 1.5 的 SFT 配方、RL 配方。计划:模型量化配方、AlpaGym 闭环训练配方
怎么加自定义训练数据:转成与 PAI 数据集相似的格式,参考 src/alpamayo/data/pai.py。怎么在 RL 里用不同奖励:实现自定义奖励并接入聚合奖励,参考 recipes/alpamayo1_x_rl/rewards/aggregated_reward.py
开源的配方仓库今天提供 Alpamayo 1 和 1.5 的 SFT 与 RL 微调配方,计划加量化配方和 AlpaGym 闭环训练配方。开发者最常问两件事:加自己的数据转成物理 AI 数据集的格式,照着 pai.py 写数据加载。换奖励看 aggregated_reward.py,实现自己的奖励函数,接进聚合奖励。

GTC Taipei 舞台:NVIDIA DRIVE Hyperion Robotaxi 平台,宣布 Alpamayo 2 Super Robotaxi 推理模型。屏幕:Alpa 仿真器、Alpamayo 与 OmniDreams 开放模型、训练数据生成、Halos OS、DRIVE AGX Thor
Alpamayo 2 Super:32B 参数驾驶基础模型,今夏发布。全 360° 环视感知;更强推理与因果链输出;元动作输出(变道、让行、停车);推理自动标注与视觉 grounding;推理、预测、对齐任务 SOTA
最后是预告。黄仁勋在 GTC Taipei 宣布的 Alpamayo 2 Super,今年夏天发布:32B 参数,当然写文章的现在,这个已经发布、全 360° 环视感知、更强的推理和因果链输出、元动作输出、推理自动标注与视觉 grounding 能力——用于规模化数据标注。
Vehicle 点评
第一,配方仓库里 aggregated_reward.py 这个文件,是整个开放生态里最值得国内团队精读的一份代码。奖励函数定义了"什么叫好驾驶"——它是 RL 阶段的标注指南。英伟达把它开源,等于把自己对"好驾驶"的量化定义公开了。国内团队应该逐条看它奖励什么、惩罚什么,然后问:在中国路况下,这些权重对不对?比如"舒适度"和"通行效率"在北京早高峰的权重,和在硅谷不会一样。
第二,Alpamayo 2 Super 的能力清单里,"推理自动标注"排在"SOTA 性能"之前。这个排序不是偶然。32B 模型的首要用途是给数据打标签——它是自动标注流水线的引擎,其次才是被蒸馏的老师。这和开场演讲里"云端大模型先当裁判"的定位完全一致。国内团队评估 Alpamayo 2 Super 时,应该先看它当标注器的质量,再看它当策略的质量。
七、问答环节里的增量信息
十分钟问答,八个问题,信息密度很高。
开源版与车上版第一个问题被问到开源模型是否含地图。You 先澄清:开源的这个模型不是车上正在测试的那个。开源模型接受的是类 Google 地图的轻量导航——"右转、左转"——不接受地图输入。
SFT 与 RL 的数据用的是同一批数据吗?答:有重叠,但为了"验证 RL 的作用",两个阶段的数据分布刻意不同。
泛化没见过的国家能开箱即用吗?相机少一路呢?You 说"我们自己也对泛化性感到惊讶"——日本的用户试了,推理和轨迹都合理。但要在新的域里做到最好,最好在自定义数据上做一轮 SFT。相机配置很灵活:两路(前 + 前长焦)也行,四路也行。
导航敏感度Honda Research Institute 的 Piyush 说他试过,模型对导航指令不敏感,而且输出多条轨迹。You 的回答很坦率:导航对模型只是一个提示,不保证严格执行;导航要放对距离才有效——"100 米后右转"模型看不到 100 米外,会忽略;说对了距离反应很准。不行就上 CFG。CFG 是单一固定值,用留出验证集挑。
VLM 的 RL 输出对 VLM 做 RL 时用什么输出算奖励?答:推理输出、元动作、轨迹三者聚合。追问:所以 VLM 也出动作 token?是。
反事实的真值反事实"没有发生过",真值怎么造?一位同事补充:用教师模型评估动作预测、给出正确的推理链,蒸馏给学生模型。
感知头会像 Tesla 那样加感知输出头或占用网络头吗?答:大概不会为不同任务加专用头——目标是一个基础模型处理各种任务。想检测物体,用提示问它;想自己接感知头,用最后一层潜变量解码,"完全可以"。
Vehicle 点评
第一,"开源的不是车上测试的那个"这句澄清,划出了英伟达的边界。开源模型是研究工具和生态入口,量产模型是另一套东西——多半有地图输入、有更多传感器、有 Halos 安全层。国内车企在评估"用 Alpamayo 开源模型能走多远"时,应该清楚:你可能需要研究实践,不能够拿用量产。
第二,"不加专用感知头"是一个明确的架构立场,和国内主流相反。国内多数端到端方案保留了感知头——用于监管要求的可视化,也用于安全兜底。英伟达押注"一个模型、提示驱动、什么都能问"。这两条路会在未来两年分出高下:如果 VQA 式的感知查询能满足监管的可视化要求,国内的多头架构就显得冗余;如果不能,英伟达要补课。国内团队现在不必选边,但应该在自己的模型上测一下"用提示做感知"的精度上限。
第三,Honda 研究员的反馈是整场问答最真实的一条信息。一个用过模型的人说"它对导航不敏感"——这不是英伟达的 PPT 会写的。You 的回答实际上承认了导航引导的局限:它依赖训练分布,超出分布就失效。国内团队如果要做导航条件的 VLA,应该把这一点写进需求:导航指令的距离、类型、时机分布必须覆盖实际使用场景。
八、写在最后:自动驾驶和机器人行业内能从这 33 分钟里拿走什么
把七个章节拢起来,You 讲的其实是一件事:从 Alpamayo 1 到 1.5,模型没变大、数据没变多,变的是后训练——RL 做得更大、更宽、更有章法,模型就学会了在难的场景里多想一步、在说话之外把车开好。这套后训练配方现在可以下载。站在中国汽车行业的角度,我认为有五条是可以直接拿走的。
一、后训练的算力预算要单列,而且要占大头。英伟达从 1 到 1.5 的主要提升来自 RL 后训练规模化,不是预训练。国内团队的算力分配方式应该重新审视。
二、推理头和动作头的 RL 分开做、分阶段做。先训 VLM,冻结,再训动作专家,再对动作专家做 RL——这个课程带来 4.7% 的闭环提升,可以直接复制。
三、RL 基础设施是先决条件,不是可选项。每步 4,000 条 rollout、64 倍吞吐,靠的是 LLM 训练那套异步基础设施。自动驾驶团队要么自建,要么和大模型团队深度合作。
四、精读 aggregated_reward.py,然后按中国路况改权重。奖励函数就是 RL 阶段的"标注指南"。英伟达的版本是硅谷口径,舒适度、效率、规则遵循的权重在中国要重新定,这就是各家需要调的配方。
五、推理标注里要有"反思"的样本。反事实推理是涌现的,但涌现的前提是训练数据里有"先提议、再否定、再修正"的结构。标注格式决定模型会不会反思。
最后说一个细节。You 在讲潜空间推理时,给了一组对比:同一个决策,文本推理用 90 个 token,潜空间推理用 38 个。他没有展开说的是,这 38 个 token 人读不懂。整场演讲的前半段在论证"让模型把推理说出来"有多重要——可内省、可监控、可解释;后半段又在论证"让模型不说出来"有多快。这两个方向不是矛盾,是分工:云端的 32B 模型负责把话说清楚,给人看、给标注用、给评估用;车端的蒸馏模型负责在潜空间里想快一点,把车开好。可解释性留在云端,效率下放到车端——这可能是推理型自动驾驶最终的形态。国内团队在争论"VLA 要不要可解释"时,或许应该先问:在哪一端可解释?
参考资料以及图片
【PPT】autonomous driving with reasoning models / Yurong You*未经准许严禁转载和摘录
原文标题 : 详解英伟达VLA自动驾驶模型Alpamayo的架构和训练方法
(来源:维科网)





