投中网
搜索
登录 | 注册
投中网  >  硬科技  >  正文

影身智能远不止“中国版worldlabs”

投中网   |   簪竹
2026-09-30 15:40:07

成立2年多以来完成5轮融资。

9月28日,AMD宣布以约82亿美元(超550亿人民币)收购李飞飞创办的World Labs,采用全股票交易。从行业发展方向上看,李飞飞和苏姿丰是看到了4D数据scaling up的转折点,所以才有联手的契机,这对4D世界模型发展,是个很积极的信号。

此前不少国内世界模型公司,只是在开源视频生成模型或者传统仿真引擎,或者干脆在VLA外面套上一层新概念外壳,靠着POC演示就能一轮轮拿融资,估值也顶到了天上,这当然跟投资人的FOMO有关系,但看多了世界模型的PPT,投资圈也几乎集体PTSD了。

这些公司中,影身智能是一个格外特殊的样本。要知道,World Labs在9月份才推出新模型Atlas,把图像生成和三维重建统一到这一个模型中。而影身智能在2024年6月成立时,就一直专注于原生4D动态世界模型的研发。

所谓4D就是三维空间加一维时间。传统的视频数据是二维的,如果用这些数据训练模型,无论如何AI理解不了空间关系和大量的物理信息。影身智能创始人、CEO闵伟将一开始就坚持4D的原因讲的很清楚,“从第一性原理出发,物理世界就是4D的”。

可以说从资本层面,World Labs被AMD收购,验证了影身智能一直以来坚持的技术路线,但不代表World Labs的路线就是一切。

从诞生之初,影身智能就把科研底座和产业落地摆在同等高度,团队在攻坚动态三维重建、接触力场建模这些底层难题的同时,一边与产业方合作解决真实的痛点。实际上,虽然技术哲学上一脉同源,但影身智能早已走出了一条区别于硅谷Neo Lab,属于中国公司的独有路径。

因此,这次收购也相当于国内世界模型公司们递过来一面镜子,或许还面“照妖镜”,看看尤其是大厂,或者说真实世界到底需要什么样的世界模型。这笔交易真正的价值并不止那82亿美元,也在于李飞飞拿到的这个“大结果”,为世界模型树立起一套可以参照的技术范式。

这次收购也绝不是伪世界模型们的救命稻草,反而将倒逼国内整条赛道技术逐渐收敛,伪概念项目的生存空间未来会被不断挤压,会有一批真正坚持原生3D/4D世界模型的公司脱颖而出。

从ImageNet到Atlas

World Labs于2024年成立于旧金山,团队约70人,累计融资超过12亿美元,上一轮估值约50亿美元。收购完成后,李飞飞将出任AMD执行副总裁兼首席科学家,直接向CEO苏姿丰汇报。

理解语言,理解图片和视频,理解现实世界。这是AI介入人类生活的三个层级。大语言模型是个略显偶然,一开始看好的人不多,但现在却成为绝对主流的路线,而后行业沿着Scaling law激战多模态,李飞飞从一开始就将目标指向真实世界。

“AI教母”不是吹出来的,李飞飞实实在在奠定了现代深度学习的基础。2009年,整个计算机视觉行业还处在停滞状态,所有人都在微调算法抠细节,一年到头性能提升微乎其微。

李飞飞判断问题不在算法而在数据。她带着学生标注了1500万张图片、两万多个类别,全部免费开放。她在自传《我看见的世界》里写过,”ImageNet不仅是一个数据集,它是一个假设、一个赌注,即实现真正机器智能的第一步,是沉浸在完整的视觉世界中”。

后面将近二十年她做的事没换过方向。2024年创办World Labs,她的表述是,“解决空间智能问题,理解3D世界、生成3D世界、在3D世界中推理、在3D世界中做事,是AI的基本问题”。服务对象始终是人,而人要待的地方是物理世界,这是李飞飞研究的基础理念。

为什么说AMD收购的价格不算夸张?因为相比硅谷其他的Neo Lab,World Labs产品迭代的堪称神速,2024年的LWM、2025年底的Marble,以及今年9月的Atlas。

World Labs最新推出的Atlas模型,就是李飞飞理念的落地成果。过去行业里,图像生成和三维重建是两套完全割裂的模型,各做各的、互不兼容。Atlas直接把两者统一到一套空间框架里,每一张输入图像都带着真实的相机位置和空间姿态,模型可以像大模型预测下一个文字一样,预测下一个空间视角。

Atlas也彻底降低了三维重建的门槛。不需要昂贵的专业扫描设备,只用几台普通手机、一段日常拍摄的短视频,就能完整重建三维场景,还能任意生成新视角、深度图和空间点云。更重要的是,它可以把真实拍摄的场景,一键转化为可用于机器人训练的仿真环境,打通真实物理世界和虚拟训练世界。

AMD之所以果断收购World Labs,就是想把空间智能的前沿需求,直接前置融入芯片研发流程,也与Atlas有直接关系。更何况苏姿丰本身就是World Labs早期投资人,也是李飞飞多年好友,今年CES大会两人同台官宣模型提速4倍的合作成果,短短九个月,合作直接升级为全资收购。

而决定模型效果的就是数据。与ImageNet时期一样,李飞飞也认为AI落地真实世界最大的卡点就是数据。但高质量的3D/4D没有现成的。World Labs采用的了一套混合数据策略,借助互联网公开的视频,再加上自己采集的真实素材,用Real-to-Sim的方式,低成本高效率的训练出了Atlas。

但李飞飞也在访谈里坦诚,这种方式的短板是,无论是互联网视频还是手机拍的素材,大多缺少接触力、材料形变、摩擦这类精细物理标注。仿真可以把几何外观做得很逼真,可柔性物体受力后的真实反应,很难凭空生成。

想要拿到这种带真实物理交互的4D样本,采集成本会瞬间飙升,而这一点,刚好就成了和World Labs最核心的分叉起点。影身智能比World Labs更早落地4D物理世界路线,靠着一套原创的数据采集、模型能力输出和落地进厂的整体解决方案,影身智能已经形成了属于自己的数据飞轮。

难却正确的路

影身智能创始人闵伟是清华精密仪器博士,深耕柔性操作领域二十年,在阿里本地生活从零搭建起完整的机器人团队,主导过阿里配送机器人的研发和商业化。首席科学家刘烨斌是清华长聘教授,在动态三维重建领域沉淀了二十多年技术积累。

34bcc5faf832ebb0cfe9a7ad46d7b360.png

放在两年前的行业环境下,影身智能的选择采集4D数据来做世界模型,多少有点逆潮流,因为2024年6月刚成立时,大语言模型是最火的时刻,也是行业最盲目信任Scaling law的时候。

影身智能认为,这套路线有绕不开的硬伤。“语言是人类的母语,而机器的母语存在于三维物理世界中”,图片、视频本质都是现实世界的投影,降维的一瞬间,深度、形变、接触受力这些关键物理信息就会丢失。

模型学到的往往只是像素层面的相关性,而不是真正的物理因果,放到皮革、鞋材这种非标柔性物体面前,真机作业很容易莫名其妙失效。

闵伟曾经说过一句很形象的话,网上海量的数据,有时候还不如一个产线老师傅几十秒的操作有价值。老师傅抬手、涂胶、贴合、按压的每一个动作,都包含着细腻的物理变化,这些细节,二维数据完全记录不下来。

等到行业反应过来,开始大规模建数采中心,采集规模又一度成了融资故事里的硬指标,各种采集方式也随之产生,本体采集、无本体采集、合成仿真新概念一波又一波。

但闵伟认为,数据采集本质上是劳动密集型行业,如果只是架摄像头、堆人力和设备,更像是在做包工头的生意。真正关键的是数据冶炼能力,就像稀土矿明明分布在很多国家和地区,但为什么世界离不开中国的稀土?真正拉开产业差距的是提纯和冶炼。数据也一样,单纯加人加设备,只能线性扩大原料规模。

过去做一次高质量4D采集,要把人放进布满80个摄像头的笼子里,整套设备价值数百万,租一天两万。今年春晚那个演员和分身共舞的节目,算下来成本至少2000元一分钟。

ImageNet在这里是最现成的一个参照。它出现之前,标注图片只有几千张,一百万张标注图片的数据集出来之后,才有了后来的深度学习浪潮。闵伟的结论与这个参照一致,每一次AI的重大变革,底层驱动力都是新一代数据集。

影身智能走的这条路正确,却艰难。

成立两年时间,影身智能才把数据采集做成一条能工业化运转的产线。影身360可以用4到5个百元级家用RGB摄像头环绕工位,加一张消费级GPU,就能以25FPS实时合成高精度4D时空数据,全程无接触,工人不用穿戴任何设备,生产照常进行。摄像头数量两年里从80个降到十几个,再降到4到5个,出数据的时间从几小时压到实时。e41653617e0f9294a0be7c5330f2efac.png

自研的破界S1世界模型,打通了视觉感知、4D时空理解与机器人动作输出的全链路。和多数模型分开做渲染画面、虚拟仿真、运动规划不同,它把所有能力统一在一套4D时空体系里完成。

系统先通过多视角重建还原真实、高保真的动态物理场景,再叠加材质、惯性、接触受力等物理参数,精准学习柔性物体的形变规律与交互逻辑,最后基于真实物理因果,直接输出可落地执行的机器人动作指令,而非单纯生成好看的画面或虚拟仿真场景。

通过原生4D数据冶炼,补齐了二维数据天然缺失的空间结构、形变逻辑与受力因果,依托高密度4D物理数据训练,破界S1从根源掌握真实物理规律,模型训练起点、任务成功率与跨场景泛化能力,实现了质的提升,这也是其能落地真实工业产线、跑出独家数据飞轮的核心底气。

数据飞轮

如果单纯把影身智能叫做 “中国版World Labs”,这个说法没大问题,但却对影身智能有些不公平。World Labs有硅谷最顶级的技术、人才、算力和资本支持,影身智能的选择是先啃那些最难的硬骨头,这也不光是技术信仰的问题,也有现实条件的差别。

影身智能和World Labs的共识很清晰,都不认可单纯依靠二维像素脑补三维世界,都相信想要理解物理,模型内部必须要有显式三维几何与时序表征;都深耕多视角重建,追求重建、生成、模拟一体化的空间智能,认可4D世界模型会成为下一代AI重要基座。

但落到模型目标、产品形态、商业飞轮,两者就走向两条完全不同的路。World Labs的Atlas重心是虚拟世界重建生成,输出三维场景、新视角画面、仿真训练环境,定位服务第三方的赋能工具。

影身智能把攻坚目标瞄准行业公认的硬骨头“双柔性” 制造,也就是柔性材料叠加柔性工艺。闵伟在晋江调研时说,服装鞋帽行业从业人员就有四千万,用工缺口巨大,晋江作为世界鞋都,自然就成了他们落地的重点阵地。

在传统鞋厂的产线上,自动化设备痛点很现实,换一款鞋型就要花一两天重新调试编程,胶水还是流体,每一次状态都不一样,老师傅可以凭手感边做边调,传统写死程序的机器根本处理不了。

2025年,影身智能拿下国内具身智能领域首个千万级柔性智造订单。2026年,在手柔性智造订单总额达到数亿元,排产规模千台级,预计今年在晋江交付约300台机器人。而且不止国内,影身智能已经与越南的宝龙鞋业、顺斐鞋业、越韩鞋业签约,首批交付数百台机器人,订单金额数千万元。3f0d171be1b31355beae64125f1af6aa.jpg

工业订单带来现金流,生产现场源源不断回流真实数据,反过来打磨模型基座,这套循环让影身智能拥有了完整的正向数据飞轮。这套完整链路,也把影身智能和市面上大批蹭概念的伪世界模型项目清晰区分开来。

因此影身智能后劲很足,成立2年多以来完成5轮融资,认可的投资人越来越多,速度越来越快,金额也稳步提升,获得了包括卓源亚洲、西湖科创投、恒生电子、杭州科创集团、翌马资本、北京未来科学城基金、杭州科创集团、东莞资本、松禾资本、深高新投、晓池资本等多家财务、产业资本和战略投资人的支持。

回过头再看AMD收购World Labs这件事,82亿美元的价格本身不算夸张,相比World Labs半年前的估值大概只高了60%,还比不上许多公司几个月翻几倍的增长,真正让行业关注的,是World Labs作为硅谷最顶尖的AI实验室,第一次有了公开市场明确、清晰的定价,这跟一级市场的估值不可同日而语。

这笔收购必然是世界模型的一个重要的milestone,却仍然不能称作世界模型的最终答案。经历泡沫与喧嚣,争议和PTSD,中国的世界模型将会加速“去伪存真”。最后能走出来的,一定是拥有自洽的底层路线,独有的数据生产链路,真正扎进本土产业,跑通业务闭环的实践者。


网站编辑: 郭靖
本文为投中网原创文章,转载或内容合作请点击转载说明,违规转载法律必究

0

第一时间获取股权投资行业新鲜资讯和深度商业分析,请在微信公众账号中搜索投中网,或用手机扫描左侧二维码,即可获得投中网每日精华内容推送。

发表评论

 / 200

全部评论

—— 没有更多评论了 ——
—— 没有更多评论了 ——
联系我们 欢迎投稿
  • 投中网
  • CVS投中数据
  1. 创新经济的
    智识、洞见和未来

  2. 投资人都在用的
    数据专家

返回顶部