7月30日,Google DeepMind发布了机器人系列模型Gemini Robotics 2,包含VLA模型、推理模型和端侧模型,并首次实现了对人形机器人的全身控制。
谷歌的算盘其实并不复杂:它要先占住机器人大脑这一层。手机时代,谷歌没有卖出最多的手机,却凭借安卓系统进入了大多数智能终端。机器人时代,它想重演这套平台逻辑。
这时候再看蚂蚁灵波这家公司,就有意思了。
它选择做一套通用的具身智能大脑,然后交给不同品牌、不同构型的机器人使用。说得直接一点,蚂蚁灵波想做“机器人的安卓”。
7月7日至10日,蚂蚁灵波连续推出LingBot-Vision、LingBot-Depth 2.0、LingBot-VLA 2.0、LingBot-Video、LingBot-World 2.0和LingBot-VA 2.0六项成果,形成“全栈大脑2.0”。
一周后,这套大脑出现在2026WAIC展区的药品货架前。
跟谷歌相比,蚂蚁灵波没有停留在概念上。当国际巨头还在Demo中展示模型能力时,它已经让同一套大脑驱动不同品牌的机器人,在真实的门店里干活了。
在今年的WAIC中,蚂蚁灵波几乎在展台里搭出了一间真实药房。乐聚、星尘和蚂蚁灵波自研R2三台机器人,穿梭在货架间取药。三台机器人使用的是同一套LingBot-VLA 2.0。
我在现场随机下单了一款感冒药,其中一台乐聚机器人先后完成识别、寻找、抓取和交付。不同的身体,共用同一颗大脑,这就是“一脑多体”最直观的样子。
过去,机器人行业普遍是一款本体配一套模型。换机器人要重新采数据,换任务要重新训练,进入新场景还得重新调试。机器卖得越多,后面的工程队伍也越庞大,规模效应很容易被适配成本吃掉。
蚂蚁灵波尝试把不同机器人的动作归入一套55维动作表征。目前,LingBot-VLA 2.0已经适配17个品牌、20多种机器人构型,覆盖单臂、双臂、双足和轮式等形态。
把这些数字放进药房这样的真实场景里,才显得更有商业价值。
药房这个选择也很聪明。它恰好处在结构化和非结构化之间:任务高频、流程明确,但货架和动线都是为人设计的。药盒密集、包装相似,机器人既要认出药品,也要判断货架、人员和设备之间的空间关系,然后连续完成移动、抓取和交付。
蚂蚁灵波的这套能力,已经投入到国大药房的实际运营中。不用重新装修,机器人可以直接进入原有经营环境,在夜间值班等时段协助药剂师分拣药品。能在这里跑通,既能检验通用大脑的能力,也更容易算清商业账。
也正因为已经走进门店,蚂蚁灵波的智慧药房入选WAIC“镇馆之宝”才显得顺理成章。
对本体厂来说,收益同样具体且明显。
在技术适配上,乐聚已经初步跑通了这条路。旗下KUAVO 4 Pro只用150条演示数据,便完成LingBot-VLA的后训练适配,并在95个真机操作场景中进行了系统测评。这说明,本体厂可以继续把身体和运动控制做好,把理解、规划和操作交给通用大脑;进入新场景时,也不用每次都从模型底座重新起步。
一脑多体解决的,归根结底是智能开发成本由谁承担。
如果每家本体厂都从头训练大脑,行业会被大量重复建设拖住。通用大脑把这一层做成公共能力,机器人产业才有可能形成类似智能手机的分工体系。
蚂蚁灵波在多个公开场合反复强调,“具身原生”是其最看重的技术方向。
为什么这么强调?因为会认出一个杯子,和真正把杯子拿起来,是两种能力。视觉模型看到杯子,能够说出“这是什么”;机器人还要判断杯子离自己多远、从哪里下手、用多大力,以及抓起之后会发生什么。
物理世界里的智能,是必须把感知、动作和反馈连成一个闭环。这就是具身原生的答案:从第一天起围绕物理世界训练模型,让机器人看到什么、采取什么动作、环境发生什么变化,都在同一条因果链里学习。
所以,蚂蚁灵波做的并非一款孤立的VLA。视觉模型负责看清边界,空间模型判断真实距离,VLA把意图变成动作;世界动作模型根据环境变化不断修正,视频和世界模型则提供更多推演与试错空间。
我认为,蚂蚁灵波最前置的一步就在这里:它把跨本体、空间理解和动作反馈放进了同一套机器人大脑中。
这套路线短期看有些重。真机数据贵,训练周期长,不同本体之间还有大量枯燥的适配工作。相比集中资源把一项任务做漂亮,它更慢,也不太容易讲出性感的故事。
可平台公司迟早要吃这份苦。
今天不解决跨本体,明天就要给每款机器人单独适配;今天不处理动作反馈,进入门店后就得依靠工程师长期驻场。很多成本不会消失,只会从模型训练转移到项目交付。
蚂蚁灵波首席科学家沈宇军认为,VLA和世界模型可能都不是终局,未来还会出现为物理世界单独生长出来的模型。
这个判断对准了一个真问题:机器人智能不会永远依附于语言模型。它有自己的数据结构、反馈频率和安全边界,最后很可能长成一套独立的技术体系。
这也是我看好蚂蚁灵波的原因:它在提前解决机器人规模化过程中绕不开的问题。
如果真想成为机器人的安卓,第一步是让更多人愿意使用。蚂蚁灵波陆续把视觉、VLA、视频和世界模型等能力开源,向开发者和本体厂开放模型权重与代码。
以LingBot-VLA 2.0为例,蚂蚁灵波一次性开放了模型权重、训练代码和技术报告,开发者可以从Hugging Face和魔搭社区获取。同步开源的高效后训练版本,在RTX 4090上的推理耗时控制在130毫秒以内。
把模型开源出来,也只是第一步。算力成本、响应速度和后续适配能不能过关,才决定本体厂敢不敢把它装进机器人。130毫秒的意义,就在于这套模型已经开始考虑真实部署的时间账和算力账。对本体厂来说,它更容易进入现有部署流程,后续适配的工程门槛也会下降。
本体厂拿到开源模型,可以本地部署、二次开发,少养一支从底座开始训练模型的团队。开发者也能跳过大量基础工作,更快进入具体任务。
至于机器人的使用数据是否回流、如何使用,仍然需要双方通过授权和合同约定。开源模型不等于把数据一并交出去,本体厂仍然保留选择权。
蚂蚁灵波得到的,是更多机器人构型和真实任务带来的反馈。合作伙伴越多,模型的兼容范围越大,它的接口也越可能变成行业习惯。
这笔交换必须让双方都划算。否则,“机器人的安卓”只是一句好听的类比。
一套大脑值不值得接入,最终还得看它能不能解决真问题。空间智能,就是一个很具体的观察窗口。
沈宇军在解释空间智能时,举过一个很直观的例子。
深度相机遇到鱼缸玻璃、水体和反光物体时,很容易丢失空间信息。人能看见鱼缸的边界,机器人未必。它可能已经识别出鱼,却不知道中间还隔着一层玻璃。
LingBot-Depth 2.0要做的,就是把这些缺失的深度信息补回来,让机器人分清“看见了什么”和“能不能到达”。空间感知做得更好,场景方可以少改造环境,本体厂也能少做一轮现场调试。
在整套具身原生路线中,空间智能只是一块拼图,但它很能说明蚂蚁灵波的思路:从物理世界里最具体的问题入手,把那些不够炫目、却影响项目交付的底层能力补齐。
当然,蚂蚁灵波离真正的平台公司还有几道硬关。
适配20多种机器人本体,能不能进一步变成更短的接入周期和更低的交付成本;药房从样板项目走向批量复制后,故障率、人工接管和长期维护能不能控制住;开源吸引来的开发者和本体伙伴,最后又有多少愿意成为付费客户。
但长期看,我依然看好这种模式。机器人本体会越来越多,没有必要让每家公司重复训练一颗大脑。安卓能够成功,是因为手机厂商借助它卖出了更多手机;机器人大脑也要用同样的方式长大。
先让本体厂和场景方得到好处,平台才有资格谈自己的价值。药房里的机器人,已经把这件事开了个头。