第 16 章

第16章 论断:2016年前后(约 2016 年)

第十五章的结尾,为那个年代的机器人雄心留下了一个沉默的注脚。DARPA机器人挑战赛证明了一件事:即便我们造出了能走路的人形机器,它在真实世界中迈出的每一步,依然要依赖人工标记、预设脚本和操作员的远程干预。它证明双足行走的工程可行性,却也像无影灯一样照出更深的裂缝——自主决策、能源密度、系统鲁棒性,这些才是真正让机器人困在实验室围栏里的锁链。那段距离,只能用实际的摔倒、实际的失败和实际的时间来丈量。把时间拨回到2016年,那时距离福岛事故已经过去五年,距离DRC总决赛不到一年。但在另一条不那么引人注目的技术平行线上,一场真正意义上的转折已经悄然发生。当全世界还在争论人形机器人应该有几个关节、用液压还是电机驱动的时候,让机器人走出实验室的关键锁钥,已经从它的腿上转移到了它的眼睛里。或者更准确地说,转移到了它感知世界所需要付出的代价上。这一转折的实质,与当时流行叙事所暗示的方向几乎相反。

2016年前后,机器人自主移动能力出现了爆发式增长,但其根源并非某种颠覆性算法的突然诞生。无论是激光SLAM还是视觉SLAM,其核心数学框架——扩展卡尔曼滤波、粒子滤波、基于图优化的最大后验估计——在本世纪初甚至更早就已经在学术文献中确立。真正发生改变的,是传感器成本的断崖式下跌与多传感器融合框架的工程成熟。当一套此前需要七万五千美元的激光雷达加一个博士团队才能搭建起来的感知系统,突然可以用几百美元的硬件和GitHub上的开源代码在一个下午内跑通时,变化的性质就不再是技术突破,而是产业逻辑的根本重建。这一年五月,一款名为《少女前线》的手机游戏在中国大陆以不删档内测的形式正式上线。游戏中的战术人形被设定为能在复杂战场自主作战,但这个虚构设定无意间触及了一个现实问题:如果一台机器想要在未知环境里自主行动,它需要的到底是什么?现实给出的答案远比游戏冷静——不是仿人的外形,而是一个能以极低成本实时回答两个问题的感知系统:我在哪里,周围有什么。

而正是在2016年前后,回答这两个问题的代价,正在经历一场断崖式的下跌。要理解这场变化的分量,需要先看清此前整个机器人产业的困局。无论是在福岛核电站废墟里搜寻幸存者的履带式机器人,还是在DRC赛场上试图转动阀门的Atlas,所有面向非结构化环境的机器人都共享一个技术瓶颈:同步定位与建图,缩写为SLAM。这个术语描述的是一套使机器人在未知环境中一边移动一边构建地图、同时根据地图确定自身位置的技术框架。问题在于,长期以来,高精度的SLAM是一个只属于极少数顶尖实验室的奢侈品。一套能用的系统通常需要一台价格相当于中档轿车的激光雷达、一个博士团队花费数月调试的算法参数,以及一个被精心布置过的测试环境——墙上贴好标记,地面保持平整,光线稳定均匀。这种娇贵,注定了自主移动机器人只能停留在学术论文和演示视频里,不可能大规模走进工厂车间,更不用说普通人的家门。变化的第一个引擎来自传感器领域,来自那个看起来最笨重的部件:激光雷达。

在相当长的时间里,如果你想要一台能实时生成精确三维点云、帮助机器人可靠避障和建图的激光雷达,市场上最主流的选择是Velodyne公司的HDL-64E。这台大约保龄球大小的设备内部装有六十四组激光收发模组,以每分钟三百到九百转的速度旋转,向周围三百六十度扫描。它能提供厘米级精度的距离信息,代价是单台售价高达七万五千美元左右。即便是资金雄厚的谷歌无人驾驶项目,早期原型车顶部那个显眼的旋转装置,核心也是这台HDL-64E。它的存在本身就是一道门槛的实体象征:想让机器看见真实世界,你得先支付一笔足以让大多数商业计划折戟的入场费。但在2016年前后,这个局面开始从多个方向被同时突破。一方面是传统机械旋转式激光雷达的精简与降价。Velodyne自己推出了更小型的Puck型号,只有十六线,价格降到大约八千美元,已经能满足许多移动机器人场景的基本需求。另一方面,更具颠覆性的力量来自固态激光雷达。

初创公司Quanergy在2014年发布了其S3型号,一台完全没有旋转机械结构的全固态激光雷达,采用光学相控阵技术进行光束偏转。公司宣称,在大规模量产后的单台成本可以低至两百五十美元。两百五十美元与七万五千美元之间,横亘着两个数量级的差距。虽然Quanergy在后续量产中遭遇了技术瓶颈,其承诺并未完全兑现,但它在那个时刻释放出的产业信号是根本性的:激光雷达不再必须是一台精密昂贵的光学机械设备,它可以是一个芯片,一块电路板,一种像摄像头一样可以嵌入任何产品的标准化模组。这个信号激发了一轮投资热潮和技术竞赛。从2015年到2016年,全球涌现出数十家激光雷达创业公司,它们瞄准的不再是DARPA挑战赛这种尖端科研项目,而是正在爆发的自动驾驶汽车市场,以及更广阔的工业自动导引车、安防巡逻、仓储物流和消费级机器人市场。

当一个部件的潜在客户从几十家科研机构扩展为数千家商业公司时,成本下降的逻辑便不再是实验室里的技术突破,而是制造业最熟悉的规律:规模化、标准化、芯片化。激光雷达的故事只是传感器革命的一半。另一半来自一个完全意想不到的方向——消费电子领域。2010年,微软为Xbox 360游戏主机推出了一款体感外设Kinect。它的核心传感器是一个基于PrimeSense公司技术的结构光深度相机,能够实时捕捉用户肢体动作并重建三维空间信息。Kinect的原始设计目的是让玩家不用手柄也能玩游戏,但它很快就以完全超出设计者意图的方式渗透进了机器人研究领域。原因很简单:一个能以每秒三十帧输出深度图像、价格仅约一百五十美元的传感器,对于正在苦苦寻找低成本环境感知方案的机器人研究者而言,无异于天降甘霖。微软最初并未预见到这个市场,但机器人社区的反应极其迅速。在Kinect发布的头几周内,就有开发者破解了其驱动程序,发布了开源接口库。

一时间,全世界的机器人实验室都开始将Kinect装到自己的移动平台上。这个原本属于客厅游戏机的配件,成为了此后多年机器人导航研究中出现频率最高的深度传感器之一。它当然有局限:依赖红外投射,在强阳光下容易失效;有效测距范围有限,不适合室外大场景。但它以一种无可辩驳的方式证明了,消费级深度相机可以成为机器人感知的平民英雄。2016年前后,英特尔推出了RealSense系列深度模组。其D435型号可以装进手掌大小,集成立体视觉与红外投射,能够在室内外环境下提供可靠的深度信息,价格不到两百美元。类似的产品线,加上从智能手机产业溢出的微型化摄像头和MEMS惯性测量单元,意味着构建一个基本的环境感知传感器套件的成本,已经从数万美元压缩到了几百甚至几十美元量级。这不是渐进式的改进,而是一个量级上的重定价。

其意义类似于从大型计算机到微处理器的跃迁:当一种核心能力的成本被压缩到原来的百分之一以下时,它就不再是少数机构的专属资源,而变成了可以在千百万台设备上标准化部署的基础设施。但更低廉的传感器只是提供了更便宜的眼睛。要让这些眼睛看到的数据变成机器人对自身的定位和对世界的理解,还需要SLAM算法这个大脑。这里的转折同样深刻。在2010年代初期,一套能跑通的激光SLAM或视觉SLAM系统往往是某个实验室数年积累的产物:研究者需要对滤波器参数进行精细调校,针对特定场景做大量工程适配,处理回环检测的数值漂移。这些工作的复杂性使得SLAM成为一种高度专业化的手艺,而非可以规模化部署的基础能力。真正的民主化转折来自算法框架的工程成熟和开源生态的爆发。2016年,谷歌推出了名为Cartographer的开源库,提供了一套基于激光雷达的实时二维与三维SLAM方案。

Cartographer的设计哲学不同于学术界此前的许多算法框架——它从一开始就瞄准了工程稳健性,能够在各种不完美的传感器数据、非理想的环境结构和动态场景下可靠工作,同时保持较低的计算资源消耗。这意味着你不再需要一个SLAM领域的博士去理解图优化的数学细节并针对特定硬件平台逐行修改代码。一个具备基本机器人学知识的工程师或研究生,可以在一个下午内借助Cartographer搭建出一套能跑的建图与定位系统。这个事实本身就是一个时代信号:当一项技术的使用门槛从一个博士团队降至一个有良好编程基础的本科生时,它就不再是前沿研究,而已然成为基础能力。视觉SLAM领域在同一时期经历着类似的转变。2015年,西班牙萨拉戈萨大学的Raúl Mur-Artal等研究者发布了ORB-SLAM的单目版本,次年又发布了支持双目和RGB-D相机的ORB-SLAM2。这套系统在2016年前后迅速成为视觉SLAM领域最受关注的开源框架之一。

它的核心创新不在于发明了一种全新的底层数学理论,而在于将此前散布在各篇论文中的特征提取、关键帧管理、回环检测、全局光束法平差等一系列工程组件,整合进了一个清晰、模块化、文档相对完整的代码库。2016到2017年间,ORB-SLAM2在GitHub上的星标数快速增长,全球开发者社区围绕它构建了大量的教学教程、硬件适配方案和应用案例。当时研究者社区中流传着一种概括,虽难以被追溯到某个具体的发言人,却精确捕捉到了变化的实质:以前搭建一套视觉SLAM需要一个博士团队,现在一个本科生用一台几百美元的深度相机和一台普通笔记本电脑,就可以让移动机器人实时构建三维地图并确定自己的位置。这种变化的性质,不是算法的智力高度被降低了,而是算法的工程门槛被踩平了。曾经锁在少数机构档案柜里的知识,变成了任何联网者都可以获取、修改和部署的基础模块。

传感器价格的断崖式下跌与SLAM算法的工程化和开源化,这两条平行线在2016年前后交汇,催生出了一个可以被概括为移动自主性民主化的窗口期。它的结果之一,是一种最为普通、也最为广泛进入人类日常生活的移动机器人,开始在千百万家庭的客厅里静悄悄地完成自身的进化:扫地机器人。如果以2016年为切片观察扫地机器人的技术路线,会看到一个清晰的代际更替正在发生。在此之前的十年间,主流扫地机器人的导航逻辑大致是随机碰撞加红外悬崖传感器。机器以某种预设的路径密度在地面上移动,碰到障碍物后随机偏转一个角度继续前进。这种方法优点在于极其廉价——它不需要对周围环境有任何理解。缺点则同样明显:清洁覆盖率无法保证,耗时漫长,容易被困,总是在同一个区域反复打转而遗漏另外的角落。它本质上是一台靠蛮力遍历空间的吸尘器,与智能关系不大。变化始于低成本激光雷达和SLAM一体化方案的成熟。2016年,小米公司发布了米家扫地机器人,售价约为一千六百九十九元人民币。

这个价位在当时的主流激光导航扫地机器人市场中构成了实质性的突破——同期配备类似激光导航功能的国外品牌产品,如iRobot的Roomba 980,售价通常在一千美元以上。米家扫地机器人的核心是一台位于顶部的旋转式激光雷达模组,由中国本土供应商提供,成本已被压缩到可以接受消费电子量产的范围内。与这台激光雷达配合的是一套经过工程优化的SLAM算法,能够在几分钟内扫描整个房间、构建出精确的平面地图,并据此规划出高效的回字形清扫路径。这台机器首次进入一个新环境时,会沿着墙边巡视一周,然后开始有条不紊地在房间内往复移动,其路径呈现出一种此前只在工厂自动导引车身上才能看到的规律感。从本质上讲,这台售价不足一台高端智能手机的圆形塑料设备,已经具备了五年前DARPA挑战赛中那些百万美元级机器人梦寐以求的核心能力:在未知室内环境中实时构建地图,精确定位自身,并据此自主规划运动路径。

区别在于,它不再需要人工标记,不再需要外部运动捕捉系统,不再需要一个博士团队在旁边的电脑上调参。它安静地履行着感知、建图、定位、规划的循环,而使用者只需要按下一个按钮。到2018年前后,更进一步的技术路线开始进入量产阶段:视觉SLAM。iRobot的Roomba i7系列抛弃了顶部的激光雷达模块,改用一颗面向前方的摄像头,结合陀螺仪和轮式里程计,通过视觉SLAM算法实现建图与导航。视觉方案在精度和黑暗环境下的鲁棒性通常弱于激光方案,但它具有一个商业上不可抗拒的优势——更低的物料成本,更薄的机身,以及通过视觉识别具体家庭物体的可能性。在这一代扫地机器人的电路板上,用于运行SLAM算法的处理器,很多是基于ARM架构的低功耗芯片,其计算能力远不及实验室里的高性能图形处理器工作站,却已足够支撑起一个家庭环境中的实时姿态估计和路径规划。从随机碰撞到激光SLAM再到视觉SLAM,扫地机器人用不到十年时间完成了一条完整的技术进化曲线。

而这条曲线上的每一次跃迁,都不是由某种天才算法独家驱动的——这些算法的基础数学框架在本世纪初甚至更早就已确立——而是由传感器成本的下降和工程集成能力的提升依次解锁的。这一观察反过来构成了对算法驱动说的一个有力反驳。如果将自主移动的爆发简单归因于某个算法的发明,就遮蔽了一个更关键的历史过程:同样的算法思想,只有当它能够被封装在一个几百美元、几十瓦、手掌大小的硬件系统里运行时,才真正构成了改变产业的力量。理论的种子早已被播下,等待的是工程和商业条件让它发芽。这一逻辑在自动驾驶领域同样清晰,甚至更为剧烈。2016年12月,谷歌将其无人驾驶项目分拆为一家独立的子公司Waymo。这一组织动作标志着无人驾驶从X实验室里的前沿研究项目,转变为需要直面商业化压力的企业实体。Waymo在这一时期所做的最重要的技术决策之一,就是大幅降低自家传感器套件的成本。

在谷歌无人驾驶的早期原型车上,仅车顶那台Velodyne的六十四线激光雷达就耗资超过七万美元。整套传感器配置,包括毫米波雷达、高精度全球定位系统和惯性导航单元在内,加起来是一笔足以让任何车规级量产计划望而却步的账单。Waymo的应对策略不是等待供应商降价,而是亲自下场设计制造传感器。公司开发了自有的短程和长程激光雷达,通过对内部收发模组的自主研发和光路设计的优化,据公司后来披露的信息,在2017年前后已将单台激光雷达的成本相比早期下降了约百分之九十。这不是一个理论上的进步,这是一个直接作用于商业模式可行性的杠杆。当一台无人驾驶出租车车顶的传感器总成本可以比它自身搭载的电池系统更便宜时,谈论大规模部署才具有了财务上的现实意义。2017年4月,Waymo在亚利桑那州凤凰城启动了其早期乘车者项目,开始允许真正的居民通过手机应用召唤无人驾驶车辆出行。

Waymo的案例也揭示出了这轮传感器成本革命背后一个容易被忽略的产业动态:自主移动能力的爆发,本质上是多传感器融合框架的工程成熟。没有任何一种传感器可以单独应对真实世界的全部复杂性。摄像头能看见颜色和纹理,在弱光或直射阳光下却会失效;激光雷达能精确测距,却分辨不出交通信号灯的颜色,也无法在雨雪雾天始终保持性能;毫米波雷达能穿透恶劣天气,但空间分辨率差到认不出前方障碍物是塑料袋还是石头。真正让自主移动变得可靠的方法,是把这些传感器的数据融合在一起,让它们互相校正、互相补充。多传感器融合作为一个概念早已存在于学术文献中,但要将其从实验室的离线数据处理转化为车规级的实时系统,需要克服的工程挑战是巨大的:不同传感器的数据率、时间戳对齐、外参标定、故障冗余、计算资源分配——每一个环节都需要从零开始构建可工业化部署的解决方案。2016年前后,正是这一整套融合框架开始在量产级硬件上跑通的时刻。

支撑它的,不仅是更便宜的传感器和更工程化的算法,还有来自智能手机产业溢出效应带来的高性能嵌入式处理器。那些原本为手机图像处理或神经网络推理设计的芯片,恰好也能承担起实时融合点云与图像的计算负荷。于是,当扫地机器人在家庭地板上静默地绘制地图,无人驾驶出租车在凤凰城的暮色中驶过十字路口,工厂里的自动导引车不再需要地面磁条就能自主运输物料的时候,它们共享的是同一段刚被写就的技术基因。这段基因的核心信息是:机器能否进入人类的世界,与它长了几条腿、有没有手指、会不会说话的关系,远不如与一条能力的关系来得根本——它能否以极低成本将物理空间可靠地数字化。一台机器人如果无法实时理解它所处的空间,就只能待在人类为它预先改造好的围栏之内;一旦它可以低成本地持续回答我在哪里、周围有什么,就获得了一种根本意义上的行动自由。它开始将人类杂乱无章、从不考虑机器通行逻辑的真实环境,视为可以导航、可以理解、可以行动的主场。

这种自由当然不只是技术层面的,它携带了自身的张力,一种从工程领域蔓延到商业和社会规范层面的张力。当感知和建图能力因成本暴跌而民主化,当任何一个创业团队都能用开源算法和几百美元的传感器搭建出拥有自主导航能力的机器人时,机器人产业的核心竞争壁垒便从能不能移动,转移到了另一个更棘手的问题上:移动中产生的海量数据。一台配备了激光雷达或深度相机的机器人,在其日常运行过程中会持续不断地采集周围环境的精细三维数据。这些数据包含着家庭内部的布局、物品陈设、家庭成员的活动模式,或者仓库里的货物流向、工厂里的设备分布,又或者城市街道上行人和车辆的实时位置。谁拥有这些数据?它们储存在哪里?如何确保它们不被滥用?开源算法构建的能力护城河是否足够牢固,以至于商业公司必须在数据生态和隐私保护承诺上建立新的差异化能力?这些问题的出现不是技术失败的标志。恰恰相反,它们是技术取得阶段性成功之后必然浮现的后果。

当看变成了便宜事,怎么看和看到了什么归谁管,就自动上升为主要矛盾。这种矛盾的轮廓在2016年前后刚刚开始显现,尚未成为公共舆论的焦点。但它已经潜伏在每一次扫地机器人地图上传到云端时的数据流里,每一台自动驾驶测试车回传点云到数据中心时的网络流量里,每一个开源SLAM库的新提交触发持续集成系统重新构建的流水线里。从技术史的角度看,这构成了一个经典的转折结构:某个领域最关键的问题被解决了,它的解决却立即打开了另一个领域里此前被掩盖的、更棘手的难题。这一结构同样回应着本书一直追踪的那条贯穿四十年的主线:机器人如何一步步进入人的世界。从FANUC车间里那些被严格物理隔离的机械臂,到协作机器人开始与工人在同一工位上共享空间,再到手术台上的达芬奇系统在医生的操控下延伸人手的能力,每一代机器人的扩张都伴随着对其安全性和伦理边界的重新定义。2016年前后的传感器与SLAM革命,则在这一扩张过程中写下了极为特殊的一笔。

它并非通过某种形态上更接近人类的设计来实现进入,而是通过赋予机器一种将人类世界翻译成可计算空间的语言来达成。这种翻译,安静,无声,几乎不被使用者察觉,却比任何仿人关节或拟人面容都更深刻地将机器嵌入到了日常物理世界的纹理之中。在凤凰城郊区某条宽阔而空旷的街道上,一辆白色的Waymo测试车正以巡航速度行驶。车顶的激光雷达以不可见的近红外光束旋转扫描,将街道两侧的棕榈树、邮筒、停在车道上的皮卡和远处交通灯上的红色光点,全部转化为以百万计的三维数据点。车内没有急刹车声,没有工程师紧张的讨论,只有显示屏上的点云实时更新着世界的轮廓。数千英里之外的另一个时区里,住家客厅的角落,圆形扫地机器人正沿着自己刚刚构建完的地图轨迹安静地归位到充电座。它的工作已经完成,灯暗下来,房间恢复寂静。感知的数字化已经发生,成本已经低得足以让这一切无声地融入日常。而它留下的问题——那些关于数据所有权、算法透明、商业护城河以及社会信任的问题——才刚刚从地平线上浮现,等待进入人们的视野。