投中网
搜索
登录 | 注册
投中网  >  企业服务  >  正文

大事 | 顶级VC连投4轮,刘松铭又融数亿

投中网   |   刘燕秋
2026-07-31 09:38:39

“做通往物理AGI难而正确的事情。”

我在6月报道过的LiberAI今日宣布完成新一轮数亿元Pre-A+轮融资,投资方包括360战投、国开金融、创新工场、CMC资本、彬复资本等,老股东红杉中国自天使轮连续追加四轮。三个月内,LiberAI已获得红杉中国、真格基金、美团龙珠、顺为资本等顶级机构的连续押注。

上半年,世界模型赛道上新公司层出不穷,大有“乱花渐欲迷人眼”的意思。进入下半年,资金将向头部项目聚拢,只讲故事怕是已经不行,还得拿出扎实的业务进展来。

上回,《独家 | 顶级VC连投三轮,00后清华特奖得主又融数亿》介绍过刘松铭的创业历程和LiberAI在技术路线上的选择——模型上重注原生多模态的预训练,同时构建自己的数采和硬件体系。这次,我着重跟他聊了聊预训练、人类数据与灵巧手这件事的重要性以及自研人类数据手套的进展。

这位00后创始人相信,预训练是智能产生的根源,世界模型本质上是多模态模型的延伸,关键在于引入物理模态后怎么把多模态的方法论落实。具体到人类数据,他认为文本、视频、物理三个模态必须在隐空间对齐,才能解决灵巧手在高维空间上的采样与决策难题。

谈及进展和规划,刘松铭透露,LiberAI在高自由度灵巧手上从模型训练到部署的整个环节都已经跑通,自研的人类数据手套也已进入量产阶段。到今年年底,公司会着力推进两件事:

其一,是把人类数据这件事彻底跑通,跑出人类数据的预训练Scaling Law,在泛化性上实现涌现,由此可以不再依赖仿真和真机数据,让人类数据成为最核心的支柱。

0469ca2d56030bf75c33bcb5fc78e591.png

“做夹爪,你早期100小时、1000小时就能出不错的demo,每一步都能用。我们做灵巧手,在复现人类智能之前会有一段‘沉默期’,风险确实更高。但一旦爬上去,你能链接所有人类数据和互联网视频,upside巨大。”这是刘松铭的bet。

其二,在模型架构上,LiberAI想做兼具agent能力的世界模型。这不再是单点任务的模型,而是能做推理的模型,如同"physical版的Claude"一样,在真实世界中进行任务规划、推理、执行与纠错。

夹爪还是灵巧手

具身行业兴起两三年了,在数据采集的方式和模型的技术路线上,分歧和非共识却一直都在。

Generalist AI在7月刚刚公布了模型的一项新能力——同一个预训练模型可以驱动五花八门的末端执行器,除了常见的夹爪,还有电动螺丝刀和打蛋器这类专用工具。跨本体的能力令人惊艳,不过它明确表示不看好五指灵巧手路线,认为机器人的手不会长得像人手。

“五指手只是工具箱里的一件,把机器人限制在这一种形态是想象力的失败。”Generalist AI在博客文章里表达了鲜明的态度。

在末端执行器的选择上,刘松铭有着截然不同的看法。他认为,只要把人类智能完整蒸馏出来,这种智能天然具备适应不同本体的能力。和Generalist AI恰恰相反,LiberAI没做过任何夹爪,而是聚焦在灵巧手算法和人类数据的采集与预训练上。

数据采集时,到底是“让人模仿机器人”还是“让机器人模仿人”,在刘松铭看来是个哲学层面的问题。前者对应的是用遥操、UMI夹爪和外骨骼等方式收集数据,后者对应的是用数采手套收集人类数据。

“有一种思路是让人去模仿机器人,认为这样收集出来的数据才能从人迁移到机器人上。但我们的思路恰恰相反:让人尽可能保持人的特性,追求无感采集。这样做的代价是人与机器人之间短期内的gap可能会变大,但优势在于天花板更高,运维成本低,更容易scale up。”刘松铭这样分析选择里的取舍。

当然,从算法实现上来说,夹爪和灵巧手完全不是同一个层级的难度。举例来说,夹爪只有一个自由度,状态空间是离散的0和1,控制简单、算法难度小,短期就能出demo。LiberAI部署的灵巧手有20个自由度,观测、数据采样、底层Infra和一些细节的控制上都更困难。

可部署于高自由度灵巧手的模型研发是公认的难啃的硬骨头,但在刘松铭眼中很有意义。“这就像在爬雪山,如果你接受这种难度,一旦登顶,优势巨大,能链接所有人类智能。夹爪路线我们最早已经验证过,从夹爪泛化到灵巧手很难,但我们的模型从灵巧手迁移到夹爪很容易,终局我们也更坚信目前选择的人类数据与灵巧手路线。”

支撑这一判断的逻辑是:既然终极目标是让机器人具备人类级别的通用操作能力,那么人类数据就是不可替代的“石油”。人类数据天然产生于灵巧操作之中,夹爪数据再多,也无法和人类视频完成对齐,难以scale up到通用智能。

"不可能三角"和数据金字塔

为了实现这一目标,LiberAI主要做了三方面的工作:

一是数据基建与工程算法,包括整个数据pipeline的搭建——如何清洗数据、逐帧切割互联网视频、从中检测出手部并优化手部检测算子的速度,从而快速切分出手部数据。整个链路要执行得快,切分边界也要清晰,比如喝水动作中,何时抓杯子、何时拧瓶盖,都要能从视频中准确识别并切分。

目前这套data infra和数据管线已完全体系化,自动化率在90%以上,基本通过API和自研微调模型完成自动打标,而且管线本身是agent在监控和优化,会越标越聪明。

二是模型本身的训练。关键在于提升模型能力,使其能在复杂空间上高效采样。文本、视频、灵巧手动作,这三个模态需要对齐到同一个隐空间中采样,才能提升对手部的感知、采样和控制效率。LiberAI团队已经做了大量human data和多模态训练,将它们对齐到统一空间。

要让这条路线跑通,还要攻克数采手套的“不可能三角”:高精度、可穿戴性、抗电磁干扰且抗遮挡。刘松铭介绍,LiberAI自研人类数据手套已攻克以上不可能三角,进入量产阶段及规模化in the wild采集阶段。

每家具身公司都有自己的数据recipe,如今数据类型已经大体上收敛到互联网视频、真机遥操、UMI、人类数据等几种,但不同企业的配比仍有差异。

在LiberAI的数据金字塔里,第一视角和第三视角的互联网人类视频数据占据绝对塔基,比手套数据大1-2个数量级;手套数据次之,比真机数据大1-2个数量级;真机数据最少。这家公司的愿景是,人类数据可以成为最重要的支柱,不用再高度依赖成本高且规模受限的真机数据。

这是一个看上去颇为激进的赌注。要知道,去年行业里的主流说法仍是通过遥操采集真机数据。

这家公司也正在尝试将数据采集团队与agent系统深度结合在一起。比如,当模型推理发现“叠衣服强、收垃圾弱”,agent会自动发布任务,调度更多人去采收垃圾数据。

用AI管理AI的数据,听上去很酷,这是AI for AI时代全新的组织思路。

灵巧手和数采之外,我们还聊了聊行业竞争和企业文化,以下是我们的部分对话内容。

刘燕秋:灵巧手这么难,行业里不少人选择放弃五指,去做二指或夹爪。你为什么坚持一定要做五指灵巧手的算法?

刘松铭:这是一个短期和长期的问题。做夹爪,你早期100小时、1000小时就能出不错的demo,每一步都能用。我们做灵巧手,在复现人类智能之前会有一段"沉默期",风险确实更高。但一旦爬上去,你能链接所有人类数据和互联网视频,upside巨大。

从第一性原理来看,我们更愿意追求难而正确的事情。

刘燕秋:你说的“杀死真机后训练”是什么意思?

刘松铭:我们前面说,一方面是拥有足够的人类智能;另一方面,自研本体,可以设计得更接近人本身。目标是不需要采真机数据,直接做迁移,从而根本上克服真机数据成本高、难以规模化的问题。目前我们仿人本体已启动量产,硬件的OS系统是用agent的方式来做。之前硬件坏了,需要人去排查,现在用agent 帮你做这部分工作,它可以自行排查哪里损坏,甚至帮你做客服,使用更加便捷。我们现在把这一套都让 agent 接进来,随着它见到的各种错误、交互越来越多,它会越来越聪明。

刘燕秋:这个思路听上去挺 AI native 的。

刘松铭:对,我们也是用新的思路来做,用 AI 的思路在做硬件。

前面提到的数据管线是一个agent,本身是个生命体,会去监控 pipeline 里面出现了什么问题。因为我们现在90%的自动化率,总会有些 agent 覆盖不到。它能自己去总结和概括覆盖不到的问题是什么,再去迭代它自己的模型和算法。我觉得这是 AI for AI 的思路,把它自己做成一个 self-improvement 的 system。

包括数采环节,一方面跟外包商合作,另一方面整个管理系统agent化。任务的下发、核实、简单的沟通和客服,都用 agent 来做。数据采完之后去训模型,模型再推理,它会去看模型推理的整个效果,然后反过来去改发布的任务。比如说你发现模型叠衣服非常厉害,收垃圾比较差,那么它就会去发布任务,让更多的人去采收垃圾的数据。

刘燕秋:作为新一代的具身公司,怎么看更早成立的公司?如果出现新的技术和数采路线,更早成立的具身公司不一定有先发优势?

刘松铭:假设你采了五万、十万小时的夹爪数据,现在要做灵巧手,这些数据怎么办呢?再比如,你进家庭采遥操数据,要搭运营体系、货拉拉调度,还要维修工程师跟着。假如现在不采遥操了,那个体系还要不要?确实存在一些现实的问题。

很多体量更大的公司内部同时跑多条路线,难以押注在某一条,这恰恰是不自信。初创公司必须focus和快速迭代,创始人一天就24小时,同时开几条路线,可能哪条都赶不上。

刘燕秋:那你不担心all in这一条路线万一赌错了?

刘松铭:第一,这是基于第一性原理的推导,最早我做的具身基础模型预训练papar及无本体数据scaling效果验证了我们的能力,我也看到了过往路线的局限性;第二,我们也在持续逐步验证,在过程里更坚信我目前选择的道路,我从去年年中就坚持押注的这条道路,而如今也在逐步脱离非共识。

刘燕秋:但先发者毕竟有技术和数据积累,完全无法融合到新路径里吗?

刘松铭:知行合一非常关键。历史路径依赖强,招的人可能存在匹配性问题。很多公司从其他领域招人,但我们发现最match的人要么是很年轻的具身研究者,要么是做视频、做多模态的。组织大了,不匹配的背景会成为包袱影响迭代速度。

一批先发者目前主要任务也许更多是冲刺上市,第一性角度的目标和我们不一致。我们的赌注是去冲刺AGI的到来,更加纯粹,更加专注,轻装上阵,快速迭代,斜率更陡峭。

刘燕秋:你赌一到两年时间内有突破,依据是什么呢?

刘松铭:依据是我们觉得现在已经解决了数据的问题,剩下大模型的发展会非常快。从原理上来说,这个问题还是个多模态的问题。既然是个多模态的问题,就有多模态的解法,而且多模态已经被证明在很多领域内都成功,这个领域也不例外。

刘燕秋:现在和国外的顶尖具身公司相比,你们的差距和跨度是什么?

刘松铭:我觉得模型上差距不大,因为我们最新的还没有发,我们自己看到的涌现,已经是跟硅谷同一个起跑线,大家是并肩赛跑。国内理应硬件上更领先,但因为种种原因,很多还停留在遥操的时代。

刘燕秋:你是00后,投资人会不会关注你的管理能力?

刘松铭:投资人问了很多跟文化、管理有关的问题。我的回答核心是三点:利益、信息、价值观。

利益上,公司是个同心圆,以愿景和业务为核心,从CEO到高管再到基层,分配要fair,每个人都从公司的发展中获益。信息上,我们高度align,我自己也会写memo内部分享思考。我觉得写作比语言沟通更深刻、不带情绪。价值观上,我们推崇谦逊、有同理心,考察候选人是否足够开放,愿意放下ego与他人协作。我们始终one team,one goal,反对山头文化。我们不会刻意筛掉没有光鲜履历的人,更看重是否有direct evidence,来证明具备工程化能力。这也是我们企业文化里很核心的一部分。


网站编辑: 郭靖
本文为投中网原创文章,转载或内容合作请点击转载说明,违规转载法律必究

0

第一时间获取股权投资行业新鲜资讯和深度商业分析,请在微信公众账号中搜索投中网,或用手机扫描左侧二维码,即可获得投中网每日精华内容推送。

发表评论

 / 200

全部评论

—— 没有更多评论了 ——
—— 没有更多评论了 ——
联系我们 欢迎投稿
  • 投中网
  • CVS投中数据
  1. 创新经济的
    智识、洞见和未来

  2. 投资人都在用的
    数据专家

返回顶部