一台长1.2米的四轮小车,在加州科罗拉多沙漠里自己吭哧了37小时,跑完26公里。全程工程师只做了最低限度的干预。最高时速1公里,看着慢,但这已经是毅力号和好奇号火星巡航速度的十倍。过去三十年,行星车靠六轮摇臂底盘硬扛地形,工程师在地面遥控指令,车在地上慢慢挪。现在ERNEST原型车换了打法,把方向盘彻底交给了强化学习算法。 这车没写死避障规则。它靠的是在虚拟环境里反复试错后长出的肌肉记忆。训练逻辑很直白:先给算法设定越障目标,让它在仿真器里疯狂摔跤,记录每一次打滑、倾斜的反馈数据。算法自己摸索出哪种悬挂角度最省力,哪种转向路径最稳当。等虚拟沙盒里跑通了,团队直接把策略部署到实车。真车进沙漠,遇到沙丘和碎石坑,主动悬挂配合全向轮,自己判断是硬跨还是绕行。 很多人一听到强化学习就犯怵,满脑子都是数学公式和算力焦虑。但NASA这次实测把底牌亮得很清楚:算法落地不拼模型多复杂,拼的是高保真虚拟仿真和小步实车试错捏在一起的工程闭环。虚拟跑通只是热身,真车在物理世界里碾出的那道车辙,才是检验这套流水线能不能跑通的唯一标准。 跑得快只是表象,底盘硬件的换代才是AI算法能施展拳脚的前提。过去三十年,行星探测车靠摇臂底盘硬吃地形。这套被动机械结构像老式三轮车,遇到坑洼全靠轮子硬扛,工程师在地面算好角度再发指令,车只能机械执行。但强化学习要的不是听话的履带,而是能实时响应策略的关节。ERNEST直接把摇臂砍掉,换上可升降网状轮组和主动悬挂。四个轮子独立调节高度与角度,悬挂能在主动和被动模式间切换,前部动力关节甚至能让车身像尺蠖一样蠕动或切换轮式行走。 自由度打开后,算法才有地方**。传统摇臂的物理反馈是固定的,强化学习模型丢进去,根本学不到动态平衡的边界。主动悬挂把底盘变成了可编程的肌肉。算法在仿真里输出一个扭矩或抬升指令,悬挂立马给出对应的形变和抓地力变化。团队早期拿0.6米原型车死磕,连续跑通11种悬挂配置,就是为了把硬件的响应曲线摸透。物理结构足够灵活,虚拟训练出来的控制策略才能在真车上严丝合缝地对齐。 别指望复杂算法能直接救活老底盘。硬件不配合,强化学习只能退化成高级导航软件。主动悬挂的真正价值,是把地形交互的决策权从机械限位里抽出来,交给实时数据。先把悬挂的响应延迟和形变阈值测准,再让算法在仿真里跑策略迭代。底盘越能听懂指令,实车试错的成本就越低。 NASA ERNEST新一代地外探测车原型在测试场进行实地行驶,展示其主动悬挂底盘与AI强化学习自主导航系统 硬件把自由度拉满后,训练场得直接搬进虚拟沙盒。想看懂强化学习怎么练出驾驶肌肉记忆,把这条流水线拆成三步就清楚了。 先造环境。JPL没拿通用物理引擎糊弄,而是用真实地形扫描数据和早期原型车采集的扭矩、打滑反馈,捏出一个高保真数字沙盒。沙丘的摩擦系数、碎石的塌陷阈值,全按真实物理定律写死。环境越贴近现实,算法学到的策略才越不容易在真车上水土不服。 环境就位,算法进场摔打。强化学习不喂标准动作,只划奖惩红线。控制虚拟ERNEST往前开,压到陡坡打滑扣分,平稳越过障碍加分。模型自己微调悬挂抬升高度和四轮转向角度,在无数次失败记录里摸索边界。这环节最吃算力,团队把流水线架在高性能集群上,几十个虚拟实例同时跑。一个周末就能攒出几千小时的极端工况录像。以前靠工程师手动遥控试错,现在靠算力暴力穷举,试错成本直接归零。 虚拟权重跑稳后,策略直接打包刷进实车控制器。团队把算法拖到“火星园”测试场开盲盒,面对真实的沙坑和台阶看它能不能落地。主动悬挂配合机载大脑,车身姿态自己就稳住了。别指望单靠一个漂亮模型就能搞定越野,虚拟沙盒的真正作用是给实车试错兜底。把高保真仿真和线下小步验证死死绑成闭环,算法才算真正拿到了物理世界的通行证。接下来该把长距路径规划的决策权也塞进这套流水线里。 虚拟环境里练得再熟,落到真实沙石地里照样会打滑,这一步得解决仿真与现实的鸿沟。Sim2Real(仿真到现实)从来不是把训练好的权重文件直接拷贝进车载电脑。物理世界充满不可控的变量,轮胎磨损、地面含水率变化、电机响应延迟,这些完美代码里不存在的噪点,随时能让一套高分策略当场翻车。 NASA的工程化思路很务实。训练阶段不追求绝对干净的理想环境,而是把早期原型车采集的真实扭矩、打滑数据直接喂进虚拟沙盒。仿真器里的物理参数不再写死,而是跟着真实硬件的反馈曲线动态校准。算法在仿真里学到的不是教科书式的标准动作,而是带着真实摩擦和延迟的肌肉记忆。等这套策略打包部署,ERNEST在科罗拉多沙漠遇到真实碎石坑,主动悬挂的响应逻辑和虚拟训练时高度一致,根本不需要重新计算就能稳住重心。 真车部署同样拒绝一锤子买卖。团队把ERNEST直接开进JPL的火星园,在真实的沙丘、碎石和陡坡路线上做小步验证。跑完一段固定路线,立刻提取底盘实际姿态和越障数据,反向修正仿真器的物理模型。改完参数再跑虚拟测试,策略更新后拉回实地复核。这种跑一圈、调一次、再验证的短循环,把原本漫长的联调周期压缩到以天计算。算法不需要一步到位适应所有未知,只需要在每次实车试错里把误差压进安全线。 别指望靠几个漂亮的仿真指标就能掩盖工程落地的问题。Sim2Real的破局点在于把高保真环境和小步实车试错死死绑在一起。先让仿真器学会脏数据,再让真车在短距离路线里反复打磨反馈。这套闭环跑顺了,长距自主导航的决策权才能真正交给AI。 车能自己稳住姿态只是基础,真正要跑长途还得学会看地图做决策。以前漫游车遇到障碍,全靠地面团队提前画好路径,车按部就班地挪。现在ERNEST要把几公里的宏观路线规划也交给强化学习。 长距导航的工程难点不在模型多庞大,而在于怎么把大目标拆成能执行的小动作。团队在虚拟沙盒里直接拉长测试距离,不再只盯着眼前两米的坑洼,而是给算法设定几公里外的探测坐标。强化学习自己算账:硬跨陡坡耗电大,还是绕远路磨损悬挂更划算。仿真器里跑出代价最低的宏观路线后,策略直接下发到车载控制器。 真车验证照样走小步循环。团队不会一上来就放开让车连跑十公里,而是把长路线切成几段。每跑完一段,立刻抓取底盘能耗、轮胎打滑次数和实际轨迹偏移,拿回实验室反向校准仿真参数。改完模型再跑下一段虚拟测试,确认无误后拉回实地复核。这种切段验证的打法,把长距导航的未知风险压到了最低。物理世界里不存在一步到位的全局最优,只有靠短循环不断逼近的局部稳定。 这套闭环跑顺了,未来体积翻倍的月球车才有底气执行连续几十公里的科学公路旅行。主动悬挂负责微观越障,强化学习负责宏观选路,两者咬合才能撑得起极端地形的长途奔袭。别指望靠离线训练就能搞定长距导航,把高保真仿真策略和实地短途试错死死绑在一起,才是把方向盘彻底交给AI的唯一路径。