第 6 章
第6章 论断:1990年代中期(约 1995 年)
时间倒回几年前。底特律仓库里那台1988年产的焊接机器人已经沉默了很久。它的黄色漆面在荧光灯下依然鲜亮,示教器还挂在控制柜侧面,上一次编写的点焊程序仍存储在磁泡存储器里。只要通上电,它随时可以重新开始工作,以0.1毫米的重复精度在车身的预定位置打下一连串完美的焊点。但问题恰恰出在这里:它只能重复预定位置。当新一代车型的图纸送到工厂,当焊接夹具被更换,当车身钣金在运输过程中发生了肉眼几乎不可见的微小变形,这台价值十二万美元的机器就成了一件昂贵的废铁。它的完美建立在一种根本性的假设之上——世界是精确的,位置是固定的,每一次操作都是上一次的精确复现。
这个假设在1992年前后已经被汽车工业的车型迭代速度击碎,但它的技术后果要到1990年代中期才真正显现出来:当机器人被要求执行比焊接更精细的任务时,当它需要将一根销轴插入紧密配合的孔中、需要从传送带上拾取随机摆放的零件、需要在接触的瞬间感知到力的反馈时,那个建立在笛卡尔坐标纯粹抽象之上的技术体系,突然变得笨拙而脆弱。这场危机的实质是机器人与其工作环境之间关系的根本性失调。从1970年代到1990年代初,工业机器人的设计哲学一直围绕着同一个核心原则展开:通过提高机械刚性和伺服精度,确保末端执行器能够准确无误地到达预设的空间坐标。这种策略在焊接、喷涂、搬运等任务中取得了巨大成功,因为这些任务的共同特征是机器人与工件之间不发生持续的物理接触,或者即使有接触,接触力也不是任务成败的关键变量。焊接枪只需要在焊点附近定位,喷涂枪只需要与车身表面保持大致距离,搬运抓手只需要在抓取点张开和闭合。
在这些应用中,0.1毫米的重复定位精度已经足够,机器人可以年复一年地重复同一套运动轨迹,不需要知道工件在哪里,不需要知道自己在接触什么,不需要知道施加了多大的力。但精密装配任务完全是另一回事。将一根销轴插入一个配合间隙极小的孔中,将轴承压入座孔,将齿轮啮合到位——这些操作的核心不在于末端执行器到达了哪个空间坐标,而在于两个零件在接触过程中如何相互作用。销轴可能稍微偏离孔的中心线,孔壁可能有微小的毛刺,配合面之间的摩擦力可能不均匀,这些因素都无法通过预先编程的轨迹来解决。熟练的装配工人面对同样的问题时,依靠的是手指传来的力觉反馈:当销轴遇到阻力时,他们会微微调整角度,轻轻晃动,寻找到阻力最小的方向,然后柔顺地将零件推入。这个过程不依赖于绝对位置的精确性,而是依赖于对接触力的实时感知和响应。但在1995年之前,没有一台工业机器人具备这种能力。它们的手指是麻木的。这种麻木的根源在于控制系统的设计。
传统工业机器人的控制器运行着所谓的位置控制算法。它的工作原理可以这样理解:控制器内部维护着一个理想的运动轨迹,每一个控制周期——通常是几毫秒——控制器都会读取各关节编码器反馈的实际位置,计算出与理想位置之间的偏差,然后根据这个偏差向伺服电机发出力矩指令,试图消除偏差。这个闭环反馈系统确保了机器人能够抵抗一定程度的外部干扰——比如负载变化或关节摩擦——仍然准确地跟随预设轨迹。但它的致命缺陷在于,当外部环境阻止机器人到达预设位置时——比如销轴碰到了孔壁——控制器会“认为”发生了位置误差,于是加大力矩试图强行到达目标位置。结果就是机器人用蛮力将销轴压入孔中,造成零件损伤或卡死。解决这个问题需要在控制架构层面进行根本性的改造。机器人需要的不是更精确的位置控制,而是一种全新的控制模式:它必须能够感知接触力,并根据力的大小和方向来调整运动,而不是盲目地追求到达某个预设坐标。
这种模式后来被称为力控制,它的核心思想是用力反馈回路取代位置反馈回路,或者将两者结合起来,形成一个能够根据任务需要在位置控制和力控制之间动态切换的混合系统。1995年前后,这个思想在几个主要的研究中心同时被推向了工程实现阶段。麻省理工学院人工智能实验室的团队在一台PUMA 560机器人的手腕上安装了六维力/力矩传感器,进行了系统的精密装配实验。这个传感器是一个圆柱形装置,内部集成了应变片和解耦电路,能够同时测量三个正交方向上的力和三个方向上的力矩。在当时的市场上,这样一个传感器的价格大约相当于一台小型工业机器人的四分之一。它的工作基于一个简单的物理原理:当机器人末端受到外力时,传感器内部的弹性体发生微小变形,贴附在弹性体上的应变片将变形转化为电信号,经过标定矩阵的解算,控制器就能实时获知当前作用力的六个分量。硬件的原理并不复杂,真正困难的是软件。
力传感器提供的是原始数据流——每秒数百个六维力向量,这些数据中混杂着传感器噪声、机器人运动引起的惯性力、末端工具的重力分量以及接触力的真实信号。控制器必须在毫秒级的时间窗口内完成信号滤波、重力补偿和接触状态判断,然后计算出应该向各关节发送什么样的运动修正指令。更棘手的是,一旦机器人根据力反馈开始调整运动,它的位置就会偏离预设轨迹,而位置偏离又会产生新的力信号——这就形成了一个闭环系统,如果控制参数设计不当,系统就可能发生振荡,机器人的手臂会像抽搐一样来回抖动。麻省理工学院的团队采用了一种后来被称为阻抗控制的策略。这个策略的灵感来自于对物理系统的类比:当一个物体与环境发生接触时,它的行为不是由绝对位置决定的,而是由它对外力的响应特性——即阻抗——决定的。一个高阻抗的系统对外力“僵硬”,会强力抵抗任何位置偏差;一个低阻抗的系统对外力“柔顺”,会在外力作用下顺势移动。
阻抗控制的思想就是通过软件调节机器人的阻抗特性:在自由空间中,机器人保持高阻抗,精确跟踪预设轨迹;一旦检测到接触力,控制器立即降低机器人在接触方向上的阻抗,允许它顺应外力运动,就像手在黑暗中摸索一样,沿着阻力最小的方向滑入正确位置。实验数据验证了这个策略的有效性。在没有力控制的情况下,机器人完成间隙仅为0.02毫米的销轴插入任务的成功率极低,即使使用了精密夹具来辅助定位。启用力控制后,成功率跃升到95%以上,而且即使工件位置随机偏移数毫米,机器人仍然能够通过感知接触力自主找到正确的插入路径。这个结果揭示了一个深刻的事实:感知能力赋予机器人的不是更高的绝对精度——PUMA 560的重复定位精度仍然只有0.1毫米——而是一种在不确定性中寻找正确路径的能力。机器人不再需要世界为它精确排列,它可以容忍偏差,可以在接触中学习,可以在不完全信息的条件下做出合理的决策。这个转变的意义超出了装配任务本身。
它标志着机器人控制理论的一次范式转移:从要求环境适应机器,到让机器人适应环境。在位置控制的框架下,部署机器人的前提是对工作环境进行严格的工程化改造——工件必须被精确固定,夹具必须被精密制造,整个生产单元必须被校准到一个统一的坐标系中。任何偏离预设条件的变化——工件的尺寸公差、传送带的速度波动、环境温度引起的热膨胀——都可能导致系统失败。这种对环境近乎苛刻的要求,将机器人牢牢锁在了汽车焊接线、喷涂车间和少数几种高度结构化的应用场景中。但力控制打开了一个新的可能性空间:机器人可以进入不完美的、动态变化的、无法被精确建模的真实世界,因为它不再依赖绝对坐标来定义任务的成功,而是依赖对物理互动的实时感知和适应。然而,力控制也带来了一个棘手的工程问题。当机器人被允许根据力反馈自主调整运动轨迹时,它的行为就不再是完全可预测的了。在位置控制模式下,工程师可以在仿真软件中精确计算出机器人在每一时刻的位置和速度,可以预先验证整个工作循环的安全性。
但力控制引入了反馈回路——传感器信号进入控制器,控制器修改运动指令,修改后的运动产生新的力信号,新的力信号再次进入控制器——这个闭环系统在理论上可能出现不稳定,可能在某些条件下发生振荡,可能以设计者未曾预料的方式对异常情况做出反应。1990年代中期的控制工程师们面临着一个两难选择:要么保留位置控制的确定性和可预测性,但放弃对复杂装配任务的适应能力;要么拥抱力控制的灵活性,但接受系统行为可能在某些边缘情况下变得不可预测。这个两难选择在接下来的二十年中从未被真正解决,它只是被不断改进的控制算法、更强大的实时计算能力和更丰富的工程经验逐渐压制到了一个可管理的范围内。几乎在同一时期,另一项感知技术也在悄然改变工业机器人的能力边界。在密歇根州安娜堡,一群从密歇根大学机器人实验室出来的工程师正在测试一套机器视觉系统。这套系统的核心硬件是一台工业CCD相机和一块插在PC总线上的图像采集卡。
在1995年,工业级CCD相机的典型分辨率是640×480像素,价格在数千到一万美元之间。软件部分则复杂得多:它需要从相机捕捉到的灰度图像中提取出目标工件的边缘、轮廓和特征点,计算出工件在空间中的位置和姿态,然后将这些信息传递给机器人控制器。这就是后来被称为视觉引导的技术。第一代工业视觉系统的工作速度在今天看来缓慢得几乎难以置信。处理一帧640×480像素的灰度图像,在当时主流的英特尔486处理器上需要数秒时间,具体取决于算法的复杂程度和图像中目标的数量。这意味着如果传送带上的零件以正常速度移动,视觉系统根本来不及在零件通过工作区域之前完成识别和定位。工程师们不得不降低传送带的速度,或者让传送带间歇式运行,在零件静止的短暂窗口内完成图像采集和处理。这种工作循环虽然远未达到真正的实时性,但它已经足以证明一个关键概念:机器人可以看见。视觉引导解决的第一个实际问题是传送带上随机摆放的工件的抓取。
在传统的自动化方案中,零件必须通过振动盘、导轨和定位机构被精确排列成固定的姿态和间距,然后由盲目的机械手逐一拾取。这套硬自动化设备的价格往往超过机器人本身,而且每当零件设计发生变更时都需要重新制造。视觉引导改变了这个逻辑:相机从上方拍摄传送带,软件识别出每一个零件的轮廓和位置,计算出机器人应该从哪里抓取,然后将坐标发送给控制器。零件不再需要被精确排列——它们可以随意摆放在传送带上,可以有位置偏移和角度旋转,甚至可以容许一定程度的堆叠。机器人第一次表现出了类似手眼协调的初步能力:它看着目标,然后伸手去够。但这种看与动的协调在1995年的技术条件下是非常初步的。视觉系统和机器人控制器之间存在着一个根本性的时间裂缝:视觉系统花费数秒处理图像,输出一个静态的快照位置;机器人控制器接收到这个位置后,规划出一条运动轨迹,然后驱动机器人执行。
在这个过程中,机器人在运动时是盲的——它不能根据视觉反馈实时修正轨迹,不能追赶移动中的目标,不能在抓取过程中调整手爪的姿态。如果零件在机器人运动过程中发生了移位,如果传送带没有停下来,如果目标被遮挡或光照条件发生变化,系统就会失败。这种看然后动的模式,与人类手眼协调中边看边动的连续反馈机制相比,还隔着一条巨大的鸿沟。尽管如此,力控制与视觉引导在1995年前后的同时出现,已经构成了机器人技术史上的一道分水岭。在此之前,机器人是生活在笛卡尔坐标宇宙中的盲目执行者——它们精确、快速、不知疲倦,但对物理世界一无所知。在此之后,机器人开始长出感知的触角:力觉让它能够触摸,视觉让它能够看见。这两种感知能力的获得,其历史意义远远超出了它们当时所能完成的具体任务。它们第一次为机器人装上了感官-反馈-适应的闭环,将技术范式从精确执行不可逆转地推向了智能反应。这个范式转变的核心机制可以从三个层面来理解。
在感知层面,传感器将物理世界中的力、光、位移等连续信号转化为数字信息流,这些信息流携带着噪声、误差和不确定性——力传感器会漂移,相机会受到光照变化的影响,工件表面会有反光和阴影。在控制层面,传统的基于精确模型的轨迹规划方法不再适用,取而代之的是基于反馈的自适应控制策略:控制器不再依赖预先设定的绝对坐标,而是根据传感器传来的实时信息不断修正运动指令。在执行层面,机器人的运动不再是一条刚性的、不可更改的轨迹,而变成了一种灵活的、可以与环境互动的行为——它可以顺应接触力,可以追踪移动目标,可以在执行过程中根据情况改变策略。这三个层面的变化叠加在一起,产生了一个意想不到的后果:机器人开始变得宽容了。在1990年代中期之前,部署一台工业机器人需要将整个生产环境围绕它进行精确的工程化改造——工件必须被精确固定,传送带必须被精确校准,光照必须被精确控制,任何微小的偏差都可能导致系统失败。
这种对环境近乎苛刻的要求,将机器人牢牢地锁在了汽车焊接线、喷涂车间和少数几种高度结构化的应用场景中。但力觉和视觉的引入,使得机器人第一次能够在不完美的环境中工作——它可以容忍工件的位置偏差,可以适应光照的变化,可以在接触中调整自己的姿态。这种宽容能力,正是机器人走出工业牢笼、进入更广阔的人类世界的先决条件。1996年,西北大学的两位教授J. Edward Colgate和Michael Peshkin提出了协作机器人的概念。这个概念的诞生直接与力控制技术的发展相关。传统的工业机器人之所以必须被关在安全围栏里,是因为它们在位置控制模式下运行时,不会对碰撞做出任何让步——如果一个人的手臂挡在机器人的运动路径上,机器人会毫不留情地推过去,造成严重的伤害。但力控制提供了一种新的可能性:如果机器人能够实时感知到接触力,并在力超过安全阈值时立即停止或反向运动,那么人与机器人就有可能在同一空间内安全地协作。
协作机器人的概念并非凭空而来。根据史料记载,协作式机器人(collaborative robot)是在1996年由伊利诺州西北大学的教授J. Edward Colgate和Michael Peshkin所发明的。一份1997年的美国专利描述协作式机器人是“人类和电脑控制的通用机器人之间直接物理互动的设备及方法。” 其诞生背景可追溯至1994年通用汽车机器人中心的计划,以及1995年通用汽车基金会的研究资助计划,目的都是寻找让机器人有足够安全性、可以和人类协同工作的方式。第一个协作式机器人确保人体安全的方式是它没有原动力,其原动力是靠工作人员提供。
Colgate和Peshkin设计的第一个协作机器人原型并不是一个全功能的工业机器人,而是一个被称为虚拟导轨的装置——它本身没有驱动装置,而是通过力传感器感知操作者施加的推力,然后通过计算机控制的转向机构引导操作者沿着预定的虚拟路径移动。这个看似简单的装置包含了一个革命性的思想:机器人不再是替代人的自动机器,而变成了增强人的能力的协作伙伴。这个思想在1990年代中期的产业界引起了复杂的反应。一方面,汽车制造商和电子装配厂对能够安全与人协作的机器人表现出了浓厚的兴趣——在装配线上,有许多任务需要人的判断力和灵活性,但又需要机器的力量和精度,协作机器人似乎填补了这个空白。另一方面,力控制技术的实际部署面临着严峻的成本和可靠性挑战:六维力/力矩传感器仍然昂贵且脆弱,力控制算法在现场干扰和不确定性条件下的鲁棒性尚未得到充分验证,安全认证标准也完全不存在。
大多数制造商采取了观望态度:他们看到了感知技术带来的可能性,但不愿意成为第一个承担技术风险的尝试者。视觉引导技术也面临着类似的处境。在实验室里,研究者们已经证明了机器人可以从传送带上抓取随机摆放的零件,但将这些实验系统转化为能在工厂三班倒连续运行的生产设备,还需要解决一系列工程难题:相机的防护和散热,光照条件的波动补偿,算法在零件品种频繁切换时的快速重新标定,以及视觉系统与不同品牌机器人控制器之间的通信协议标准化。每一个问题单独看来都不是不可克服的,但叠加在一起就构成了一个令人生畏的工程挑战。1995年前后,真正在工厂中部署了视觉引导系统的机器人还只占全球工业机器人保有量的极小比例。然而,历史的转折点往往并不在于某项技术是否已经成熟到可以大规模部署,而在于它是否已经证明了某种新的可能性,是否已经打开了人们想象未来的一扇窗口。
从这个意义上说,1995年前后的力觉传感器和机器视觉系统,其历史地位类似于1970年代初期的微处理器:它们本身还太慢、太贵、太不可靠,无法立即改变世界,但它们已经清晰地展示了一个不同的未来——一个机器可以感知、可以适应、可以与人和环境安全互动的未来。这个未来在当时还只是实验室里闪烁的监视器屏幕上的曲线和数据,是学术会议上被热烈讨论的论文和演示视频,是少数有远见的工程师头脑中挥之不去的技术愿景。但它已经足够清晰,足够具体,足以改变技术演进的方向。这种方向性的改变可以从机器人产业的投资趋势中观察到。在1980年代,工业机器人公司的研发预算几乎全部投入到运动控制和编程系统上——如何让机器人更快、更精确、更容易编程。但到了1995年前后,一个越来越明显的趋势是,领先的机器人制造商开始将越来越多的资源投入到感知技术的研发中。FANUC在1990年代中期建立了专门的视觉系统研发团队,开始开发与自家机器人控制器深度集成的视觉引导软件包。
ABB与瑞典的大学合作,研究基于力控制的机器人装配和打磨应用。日本的安川电机开始试验将力传感器集成到机器人关节内部,而不是作为外部附加装置。这些投入在当时还没有产生立竿见影的商业回报,但它们表明产业界已经认识到:下一阶段的竞争将不再是谁的机器人重复定位精度更高、运动速度更快,而是谁的机器人能够感知并适应复杂多变的作业环境。这个判断在1990年代后期得到了初步的验证。在汽车工业中,力控制技术开始被应用于发动机装配线上的精密配合任务——将活塞插入气缸、将轴承压入座孔、将气门装入导管。这些任务长期以来依赖熟练工人的触觉和手感,是自动化最后的堡垒之一。力控制机器人虽然还不能完全替代人的触觉判断,但已经能够在受控条件下完成其中一部分任务,特别是在配合公差相对宽松、工件一致性较好的大批量生产中。在电子工业中,视觉引导技术开始被应用于印刷电路板的元件贴装和检测——相机在高速贴片机拾取元件之前快速检查元件的位置和方向,确保贴装精度。
这些应用虽然还局限于特定的、高度工程化的场景,但它们证明了感知技术不再是实验室里的玩具,而是可以产生实际经济价值的工程工具。更影响在于,感知技术的萌芽开始改变人们对机器人能力边界的基本认知。在1995年之前,当人们谈论机器人时,脑海中浮现的图景是一台在固定位置重复执行预设动作的机械手臂——它可以焊接、喷涂、搬运,但所有这些都是盲目的操作。1995年之后,一个新的图景开始浮现:机器人可以触摸,可以看见,可以在不确定的环境中做出适应性反应。这个图景虽然还要再等十多年才能真正实现,但它一旦出现,就不可逆转地扩展了机器人技术的应用边界。人们开始讨论机器人应用于食品加工——抓取形状不规则、质地柔软、位置随机的食材;应用于物流分拣——从杂乱的料箱中逐一拾取不同形状和尺寸的商品;应用于医疗手术——在人体组织柔软、变形、出血的不确定环境中进行精确操作;应用于家庭服务——在充满家具、宠物和人类的动态环境中安全地工作。
这些讨论在当时还只是畅想,但它们为后续的技术发展设定了方向。从更长的历史尺度来看,1990年代中期的这场认知革命,其意义不仅在于技术本身,更在于它重新定义了机器人与世界的关系。在精确执行范式下,机器人要求世界适应它——工件必须被精确固定,环境必须被严格控制,任何偏差都必须被消除。这是一种傲慢的姿态,它反映了工业自动化早期对完全控制的幻想。但在智能反应范式下,机器人开始学习适应世界——它可以容忍不确定性,可以在不完全信息的情况下做出合理决策,可以在与环境的互动中不断调整自己的行为。这是一种谦逊的姿态,它承认了真实世界的复杂性和不可预测性,并试图在这种复杂性中找到可行的路径。这种姿态的转变,在比任何具体的技术突破都更为根本。它意味着机器人开始从笛卡尔坐标的纯粹抽象中走出来,进入充满噪声、误差和不确定性的真实物理世界。而一旦进入这个世界,机器人就不可避免地会与人类相遇——因为人类正是这个复杂、混乱、不可预测的物理世界的最重要的居民。
但1995年的现实与这个愿景之间还横亘着巨大的技术鸿沟。力控制还只能在严格受控的实验室条件下可靠工作——当工件表面有油污、当环境温度变化引起传感器漂移、当装配过程中出现意料之外的卡滞时,算法就可能失效。视觉系统还太慢,处理一帧图像的时间以秒计,根本跟不上动态变化的环境。更关键的是,力觉和视觉这两个感知通道在当时是完全独立的——力传感器只管接触力,相机只管图像,两者之间没有信息融合,控制器无法同时利用多种感知信息来做出综合判断。看与动之间存在着一个时间裂缝:视觉系统输出一个静态的位置估计,然后机器人盲着眼睛运动过去,在运动过程中不能根据新的视觉信息修正轨迹。这个裂缝使得视觉引导无法应用于任何动态场景——移动的传送带、摇摆的零件、变化的光照条件都会导致失败。这些局限本身指明了下一步必须攻克的技术难题。如何让视觉处理变得足够快,快到可以在机器人运动的每一瞬间都提供实时反馈?
如何让力控制变得足够鲁棒,鲁棒到可以在各种不确定的工业环境中长期可靠运行?如何将力觉和视觉融合起来,让机器人同时使用多种感知通道来理解环境并做出反应?如何弥合看与动之间的时间裂缝,让机器人能够像人一样边看边动,在运动过程中持续根据视觉反馈修正轨迹?这些问题在1995年没有人能够完整回答。但它们已经被提出来了,被写进了研究计划,被列入了技术路线图。在麻省理工学院、卡内基梅隆大学、斯坦福大学和世界各地的机器人实验室里,博士生们正在为下一轮突破日夜工作。在FANUC、ABB和安川的开发部门里,工程师们正在尝试将实验室里的算法转化为可以在工厂中部署的工程系统。一种新的技术范式已经诞生,它还很弱小,很粗糙,很不可靠,但它已经证明了一个根本性的命题:机器可以获得感知,感知可以转化为适应能力,适应能力可以打开全新的应用空间。这个命题一旦被证明,就不可能再被遗忘。
1995年,那台装备了力传感器的PUMA 560在麻省理工学院的地下实验室里将销轴柔顺地滑入配合间隙极小的孔中,那台CCD相机在密歇根州安娜堡的初创公司里从灰度图像中识别出传送带上随机摆放的零件轮廓。这些场景在当时看来只是常规的学术实验和工程开发,但事后回望,它们标志着一个时代的开始。机器人第一次获得了触觉和视觉,第一次能够在不确定性中做出适应性反应,第一次展现出了走出工业牢笼、进入人类世界的可能性。感知的触角已经伸出,从精确执行到智能反应的范式转变已经启动。接下来的任务,是让这些感知能力变得足够快、足够可靠、足够便宜——快到可以在动态环境中实时反应,可靠到可以在工厂三班倒连续运行,便宜到可以进入中小企业甚至家庭。而在所有这些任务中,最紧迫、最核心的一个技术难题正在逐渐清晰起来:必须让机器人的看与动之间形成真正的闭环。