前阵子的2026世界机器人大会上有个特别有意思的反差:展台上,300余家企业、3000余件展品里的机器人忙着倒水、搬货、干活;展台下,造它们的人忙着吵同一件事——机器人的大脑,到底该先理解世界,还是先学会干活?
今天知乎热榜上也挂着这个问题。我把这一周关于路线之争的报道翻了一遍——中国经营报、腾讯科技、凤凰网科技的都看了,越看越觉得,这场架对普通人来说一点也不远:它就是我们每个人学新东西时都会遇到的那道题——先学理论,还是先上手?
"先干活派":照猫画虎
主张"先学会干活"的,技术上叫VLA(视觉—语言—动作)模型,过去两年机器人大模型的主流方案。思路很直接:给模型看大量"什么场景对应什么动作"的样本,让它学会从画面直接映射到动作,本质是模仿学习。
效果在静态、受控的场景里确实好:抓一瓶水、桌面搬运,都没问题。但短板同样明显——泛化高度依赖训练分布,分布内接近满分,一旦换成没见过的物品、没见过的场景,性能明显衰减。报道里有个概括很传神:VLA是"照猫画虎"。猫在手边,活干得漂亮;猫一撤,虎就画不出来了。
"先理解派":三思而后行
另一派认为照猫画虎不够,机器人得先理解世界。这就是最近一年火起来的"世界模型"。大晓机器人董事长、商汤科技联合创始人王晓刚在大会主论坛上说:相较于VLA,世界模型最大的特点是能对世界的未来状态进行生成和预测——一边执行动作,一边在脑子里对"平行空间"里可能出现的各种后果做推理和演绎。报道同样给了个对仗的概括:"三思而后行"。
听起来很美,但现实有障碍。机器人面对的是一个有重力、有摩擦、随时会打滑失手的物理世界,而"一件活到底怎么干好"所需的手感、力道和临场反应,从未像文本、图片那样被大规模记录下来。所以世界模型卡在两道关卡上——物理智能和高质量数据,外加功耗、可靠性这些硬约束。一句话:想得美,但"想"的教材还没凑齐。
顺便说一句,这条路线最近动静不小:李飞飞团队9月1日发布了多模态世界模型Atlas,还把世界模型按功能拆成渲染器、模拟器、规划器三类;图灵奖得主杨立昆等人也在8月24日发了新论文。学界业界都在往这压注。
吵了一年,结果是"别吵了"
如果你等着看哪派赢,可能要失望。我翻报道发现,今年大会上的路线争论反而"降温"了:去年展台和论坛上随处可见的VLA招牌,今年明显少了;世界模型虽然接棒走红,但各家定义不一——有生成未来的、有预测因果的、有在潜空间推演的。行业的注意力正从"路线之争"转向"数据之问":架构说得再好听,最终要靠数据检验。
清华大学计算机系副研究员苏航给了一个被广泛引用的判断:VLA和世界模型并非二选一。质量高、动作和任务标注明确的数据,适合VLA直接建立"感知—语言—动作"的映射;规模更大、来源更广的视频数据,则适合世界模型去学习环境变化与行为结果之间的关系。未来更可能是融合式架构:在不同时间尺度上,结合VLA的动作生成能力与世界模型的状态预测、反馈校正能力。
这不只是嘴上说说。擎朗智能在大会上发布的KOM 3.0,卖点正是融合——机器人在执行动作前,先在内部预演物理结果,然后再动手。先想(理解),后做(干活),两派的路线被装进了同一台身体里。中国电子学会机器人分会主任委员席宁的说法也印证了这个阶段:技术路线仍在"百花齐放",哪条真正有效,要等实践检验。
你发现没有,人类学东西其实也是这样:先上手的人在重复里长出手感,先读书的人在推演里长出地图,真正的高手都是边干边想、边想边干。机器人和人唯一的区别是,我们的手感天生就长在身体里,而它们的手感得先变成数据。所以行业吵到最后,集体去采数据了——架吵完了,作业才刚开始。
这道题,你也能直接抄答案
为什么值得聊这个?因为"先理解还是先干活",也是我们面对AI工具时天天在纠结的事:有人囤了一堆课程和教程,非要搞懂原理再动手;有人打开工具就一顿乱试,试完什么也没留下。
机器人行业吵了一整年得出的答案,你可以直接抄:上手干,但动手前留一步"预演"。
具体到用法上就一句话:下次让AI做事,别甩完指令就要结果,先问它"这个任务有哪两种做法,各自的后果是什么",让它把可能性推演出来,你选定一种,再让它动手。这就是KOM 3.0那套"先内部预演、再执行动作"的工作方式,缩小到你的聊天框里。我平时在 spark1.cn 的AI写作工具(/ai-writer)里就是这么练的:先让它出两版思路,选定一版再展开,比一句话要成稿稳得多。
连最前沿的机器人大脑,都还没想清楚该先理解还是先干活,它们最后的答案是"两个都要"。所以你在"要不要学AI"上纠结的时候,大可从容一点:不用想清楚再动手,边干边想,你就已经和这个行业最先进的思路站在同一边了。
本文素材综合自中国经营报、腾讯科技、凤凰网科技、第一电动网等公开报道。
💬 评论