机器人和L4级自动驾驶都卡在一个物理瓶颈上
人形机器人融资一轮接一轮,Robotaxi的新闻每月都有。从春晚的舞蹈,到各种轮式臂在物流仓库拣货,。但从“跑通demo”到“能在你家厨房干活”,中间差的不是一点半点。
有个最基础的问题没解决,机器怎么认知物理世界。
人和机器对空间的理解方式完全不同,你让我去拿个杯子,我扫一眼碗柜就去了,至于杯子离桌沿多少厘米、把手朝哪个方向、周围有什么。脑子里没这些数,凭直觉够用。但机器不行,它得知道杯口的精确朝向,把手的3D坐标,抓取点距离杯壁多少毫米。少一个数,后面的规划和控制就没法做。拿杯子失败,不一定全是感知的锅,规划算错了、控制没跟上,都可能。但感知是整个链条的第一关,这一关拿不到足够精度的数据,后面的环节连犯错的机会都没有。
给人用的感知和给机器用的感知,压根两回事。自动驾驶里的车道线检测就是个例子。人开车不需要知道车道线离车轮多少厘米,觉得差不多就行。但机器要知道,精度厘米级,且帧与帧之间不能跳变。高速上差一点就是事故。
玻璃杯是这个问题的极端版本,透明材质,深度相机打上去要么穿过去,要么噪点一片;反光表面,特征点根本对不上。这不是换个算法能解决的,是传感器物理原理的限制。
工业上怎么解决?不让杯子透明,不让场景变化,打强光,加标记。说白了,把真实世界改造成机器能处理的样子。但家庭场景没法这么干。你家碗柜不可能贴满标记。
传感器路线上,激光雷达近场精度不够,深度相机对透明和反光物体虚。算法路线上,单目深度估计本质上是个病态问题,你从一张2D图去猜3D结构,遇到没见过的场景就露馅。这些年在实验室里见过太多这类情况,算法在标准数据集上跑得漂亮,一换成真实厨房的杂乱光照,深度图就碎了。
接着以拿杯子为例,位置姿态都拿到了,手伸过去。碰到杯壁那一瞬间之前,有个事得先想清楚:杯子会怎么样?会不会滑?多大力刚好拿稳又不碎?
人做这个不费劲,这是进化给我们刻进本能里的东西,不耗任何显性认知资源。但机器做这个,目前学界有两条路。一条是显式物理引擎仿真,把力学模型写进去,给定初始条件算结果。这条路的好处是精确,问题是太慢,没法在毫秒级内跑完。另一条是学习型世界模型,用神经网络从数据里学出一个近似物理引擎。这条路快,但现阶段预测精度不够,遇到训练分布外的材质和几何就飘。
两条路都不成熟,所以目前落地系统的主流做法还是靠数据驱动,见多了类似场景,学会一个从视觉到力度的映射。问题是这个映射只在训练分布内靠谱。换个没见过的杯子,表面材质不一样,摩擦力变了,它照样按老经验出力,捏碎就是这么来的。
自动驾驶里类似的场景多了去了。旁边车道的车稍微压线,它是要变道还是驾驶员走神?这需要推演,不能只靠模式匹配。目前大部分系统的做法是把所有可能性归成几类,然后给每类一个概率,选最高的执行。这本质上还是统计,不是推演。所以那种“别的车在犹豫”的情景,L4处理得不好。
力反馈和触觉信息不像视觉,太容易获取。
这是一个常被外行忽略、但内行知道是核心瓶颈的问题。拿稳杯子的关键不在视觉,在触觉的闭环反馈。碰到杯壁的一瞬间,指尖感觉到滑移的微振动,马上加点力。抓到临界点,力不再加,保持住,整个过程毫秒级循环。
要做到这个,需要三样东西:高分辨率的触觉传感器、毫秒级响应的力控算法、把传感器信号和执行器指令实时闭环的模型。
传感器这一关就卡住了,目前的触觉传感器方案很贵,可靠性差,离量产差得远。工业场景的解决方案是干脆不用触觉,用位置控制“盲抓”——机械爪开到比物体大一点的间距,靠几何约束卡住。这也是为什么你看到的大部分人形机器人演示,抓的都是方方正正的规则物体。至于玻璃杯这种光滑且脆的东西,主流做法是当特种任务处理,用吸盘或者其他专用末端,根本不走通用抓取路线。
力控算法相对成熟一些,问题是没传感器给它输入,再好的算法也用不上。
这和L4感知路面附着力是同一个困境,视觉能猜个大概,路面颜色变了,可能在结冰。但“猜”靠不住。真正能确认的是轮胎打滑那一瞬间的力反馈,但到那时候已经晚了。这个问题行业内探讨多年,一直没有廉价的可靠方案,本质上是同一个传感器瓶颈。
实验室做演示,台上就一个杯子,背景干净。你家厨房实际什么样子?杯子旁边有碗、盘子、调料瓶,可能倒扣,可能堆叠。机器人得在这一堆东西里把杯子拿出来,不碰倒别的。
这不只是识别多了几个物体的问题,场景复杂度带来的不是线性增长,是指数级增长。因为不仅要知道每个东西在哪,还要知道它们之间的空间关系和物理依赖——盘子压着杯子了吗?碰倒一个碗会不会引发连锁反应?规划路径时,自由空间不再是空旷的,而是被各种障碍物挤成了一条缝。
得承认,视觉大模型这两年进展很快。SAM、3D高斯溅射这些,对静态场景的建模能力提升了一个台阶。但理解静态场景只是第一步。拿杯子是一个动态交互过程,抓取动作会改变场景状态,碰到一个物体可能引发连锁位移。这些连锁效应需要在动作执行过程中实时感知和调整,不是提前建个模就完事了。目前还没有系统能在复杂堆叠场景里稳定做到这一点。
在密集车流里的自动驾驶车辆,周围六七个交通参与者,各自有意图和轨迹,规划一条不碰任何人、也不吓到人的路径。目前技术走简单场景还行,一堵车就开始过于保守,不停踩刹车。
自动驾驶和人形机器人共享同一套底层,都依赖传感器、都在做空间重建、都需要预测和闭环控制。
但难度分布不一样,L4的难点在“稀疏但有致命长尾”。
99%的场景不难,难的是最后那1%必须100%安全。
现在有一种说法:只要大模型继续scale,人形机器人自然就出来了。
大模型确实能帮忙做任务规划和语义理解,但在传感器物理原理和在硬件。都不是你多喂点数据就能自己解决的。
大模型当前的强项是符号空间,互联网上几万亿token,什么都能学到。但触觉信号不在互联网上,力反馈数据没有语料。这就注定了纯大模型路线搞不定物理交互。不是架构不行,是训练数据里就没有这种信息。
页:
[1]