今年上半年,全球投资圈的热钱除了继续押注具身智能,另一个被反复提及的关键词还有“世界模型”。仅国内市场,近半年内便发生超过30起世界模型相关的融资事件,融资总额超40亿元。
7月19日,在WAIC 2026期间的“世界模型‘六小龙’巅峰论坛”上,南都湾财社记者现场获悉,大晓机器人、蚂蚁灵波、极佳视界、无界动力、智元机器人与自变量机器人等六家世界模型赛道的头部企业同台对谈。
在这场对话中,与会者的焦点不是机器人能不能做家务等特定的应用场景,而是:机器人究竟怎样才能理解物理世界的规律,并在陌生环境中自主作出决策。
“理解物理世界规律”成为共识
一直以来,外界提及世界模型,总是先想到视频生成、3D环境生成等应用,关注点集中在画面的清晰度与连贯性。但在世界模型领域,业内认为只是预测下一帧画面的模型还远远不够。
无界动力联合创始人兼CTO夏中谱指出,视频生成只是表象。正如大语言模型通过“预测下一个词”抓住了语言的逻辑本质,世界模型真正需要掌握的,是物理世界中状态的变化与因果规律。只有建立因果建模与可预测的物理认知,机器人才能推演未来并做出决策。他进一步表示,当前行业存在物理多模态数据缺失、表征架构适配性不足以及训练范式落后等短板,行业需要普及强化学习,才能让机器人突破人类操作的上限。
智元机器人AI算法总监任广辉同样表示,当前主流的视频生成模型经常出现违背常识的画面,例如夹爪未接触物体就直接抓取。对实体机器人而言,最核心的短板是缺乏“物理因果一致性”。目前的训练素材大量来自为了视觉效果而违背物理逻辑的影视短视频,行业急需大规模的原生具身交互数据集。
蚂蚁灵波首席科学家沈宇军则提醒,行业普遍混淆了“模型底层架构能力”和“模型表层展示效果”。两年后复盘,在模型架构和数据链路上的积累一定是正确的选择,但一味追逐表层的视觉观感,最终的商业价值存疑。
商业化面临边际成本与长尾场景双重挑战
在明确了技术本质后,如何从实验室走向真实产线,成为横亘在世界模型面前的商业化难题。
成本投入与商业回报的倒挂是首要痛点。自变量机器人联合创始人兼CTO王昊算了一笔账:模型效果从0做到90%的投入是可控的,但从90%提升到99%,再到99.9%,每降低一个数量级的错误率,投入成本都与前一阶段持平。如果纯技术创新无法覆盖业务收益,就无法支撑商业落地。此外,评测环境与真实部署环境的不一致,也会导致线下真机稳定性大幅下滑。
真实商业场景中不可预判的突发变量,限制了模型的规模化部署。沈宇军坦言,展会上的演示大多经过了人工复位和标准化调试,但在现实的商超或家居场景中,存在大量如商品移位、杂物遮挡等异常情况。现有模型处理这些不可预判变量的能力依然不足。
极佳视界联合创始人兼首席科学家朱政总结了前期对接工厂的真实教训:当前模型的能力上限,尚不足以支撑大规模商业化。行业此前将大量精力分散在模型之外,在技术尚未收敛成熟时仓促落地,导致大部分场景无法跑通。他认为,当前应将重心回归模型性能提升,并建立起标准化的真机评测基准,同时寻找世界模型赛道中类似大语言模型“代码生成”那样的标志性落地场景。
大晓机器人:聚焦端侧响应与真实场景闭环
针对上述行业痛点,论坛承办方大晓机器人给出了其在评价体系、模型架构及落地环节的应对逻辑。
大晓机器人首席科学家陶大程指出,世界模型不需要存储全部的世界信息,而是要提取完成指定任务所需的信息。行业评价具身世界模型的核心指标,必须从“视觉画面连贯”转向“物理智能”,即推演结果能否转化为可靠的机器人动作,以真机成功率和接管率为最终标尺。
针对商业化落地中极易被忽略的延迟问题,陶大程强调,大量世界模型的推演高度依赖云端算力集群,但机器人产线的决策窗口通常仅有几十到一百多毫秒。机器人无法长期依赖网络云端,轻量化、可端侧部署的任务导向型模型才具备更高的产业价值。
在论坛现场,大晓机器人董事长王晓刚发布了开悟世界模型3.1(Kairos 3.1)。该模型采用原生统一架构,将世界理解、内容生成和动作预测融合在同一底层空间内。数据显示,在端侧计算平台(NVIDIA Jetson Thor)上,其8B模型的平均推理延迟降至125毫秒。当机器人在执行任务(如开冰箱)失败时,系统能够自主定位问题节点,在模型内部的平行空间重新推演动作轨迹并再次执行,形成自进化闭环。
在数据端,大晓提出了“具身智能信息密度定律”,认为只有引入三维力触觉、失败恢复数据及开放环境连续交互的高密度数据,才能让模型具备真实物理认知。
目前,大晓机器人已将这套系统剥离出单一的演示形态,封装进三大垂直场景解决方案中:面向即时零售高密窄仓的履约方案“晓满”、面向酒店非标作业的无人洗衣方案“晓新”,以及面向开放环境的四足全域作业方案“晓途”。通过直接切入真实的商业履约流程,世界模型正开始接受物理业务流和商业ROI的双重检验。
采写:南都湾财社记者 严兆鑫