投中网获悉,家庭具身智能公司诺因智能完成新一轮数亿元人民币融资。本轮融资由京东相关基金领投,正心谷资本、南山战新投和华登投资跟投。成立一年,诺因智能已完成5轮融资,累计融资金额超10亿元。
和创始人李银川两个多小时交流下来,我印象最深的是那个举手的故事。
刚上高一时,每当老师提问题,李银川都是班里举手最积极的同学。因为积极抢答,他被同学起了个外号,叫“现长”,爱表现的现。叫多了,到高二,李银川也不举手,那个班就彻底没有人回答老师的问题了。
再讲起这段往事,是在他成立的诺因智能。因为这段经历,他总是鼓励大家发言,在公司讲真话。“有的时候真话会得罪人嘛,比如说某个技术方向别人做了,你觉得不对,那你为了维护关系,又不说。但不说的话,大家不讨论,公司就会多走一段弯路。”
这个小故事耐人寻味。东方传统总是不鼓励人露锋芒,认为低调谦虚才是美德。但有时,谦虚多了,就成了虚伪。我们刚夸过朱啸虎真诚,这在创投圈尤为难能可贵。希望爱发言的李银川也是一个真诚的创业者。
话说回来,被盖上了“天才”戳的李银川从不是一个按部就班型的学霸。他有反骨,跳过级,创业选择的也是非共识的方向。李银川曾任职于华为的AI lab&诺亚方舟实验室,两年半即晋升为诺亚最年轻项⽬经理,离职前的身份,是华为诺亚⽣成式⼤模型⽅向负责⼈。GPT-4o的发布使他相信,合成数据将成为To C具⾝智能的重要路径。2025年,他创⽴诺因智能,聚焦消费级家庭具⾝智能机器人。
当大多数公司卷向To B产线、用确定性订单换取营收时,李银川选择的是让机器人直接进家庭。家庭场景不依赖预先编排的任务流程,要求机器人听懂任意指令、理解环境、反思纠错,是检验具身大模型是否真正具备泛化能力的终极考场。泛化的前提,是数据。在李银川看来,靠真机遥操作采集数据训不出真正的智能。诺因智能选择了一条用合成数据把数据成本降低百倍、再按大模型的方式训练具身大模型的路线。
这条路在一年前还少有人走。“不少投资人在观望,认同我们的则非常认同。”李银川告诉我。他认为自己一年前讲的每件事,现在都被慢慢证实了——无论是合成数据,自回归泛化架构还是in context learning。接下来,就是把机器人送进千家万户。
从跳级生到华为科学家
16岁考入北京理工大学,北理工与哥伦比亚大学联合培养博士,华为诺亚方舟实验室最年轻的项目经理……李银川的履历很漂亮。而这份履历的起点,是一个安徽亳州的跳级生。
小学六年级没上,初二初三跳级,15岁参加高考。连续跳级让李银川比同班同学小好几岁,也早早练就了一套“弯道超车”的自学方法论:快速抓重点、以效率取胜、不按标准路径走。
激起他创业念头的,是大学时的一段经历。大四时,李银川被北理工龙腾院士提前招入课题组,很快便帮导师的公司做成一笔价值1亿的项目。目睹导师和师兄们把公司做到上市,让李银川一下子意识到,创业不是一件遥不可及的事。
在哥大联合培养期间,他把深度强化学习用到金融上,与师弟成为全球最早做AI for finance的人之一,开发的软件卖给华尔街公司,随后受邀担任8个月高级顾问,赚的第一笔钱改变了他职业选择的权重:2020年回国,面对300万年薪的offer,他拒绝了,选择了开价并不算高的华为诺亚方舟实验室。
而创业的念头,在20岁那年就种下了。李银川给自己设了十年目标,发够100篇论文,30岁下场。
为什么用合成数据?
理解诺因智能的路线,关键在数据。
李银川将具身智能的模型训练从数学原理上分为两派:一派以VLA模仿学习为代表,底层基于扩散或flow matching,通过最小均方误差拟合人类遥操作的真实轨迹;另一派是自回归的Transformer路线,将图像、动作与语言对齐,通过自回归预测激发全空间分布采样,生成新的动作。
前者的训练信号是人的真实轨迹,它天然需要采集数据,做遥操作;后者不需要完整轨迹,只需要场景和任务的理解。诺因智能走后者——约10%的真实第一视角数据,记录人如何操作,其余通过3D视频生成大规模合成数据,在隐空间对齐语义,训练具备原生思维链推理与in context learning指令遵从能力的具身大模型。
“去年我刚创业时,合成数据的反对声音还很多,现在几乎没有人不用了。字节也开始宣传用合成数据引擎支持具身智能的发展。”李银川说。
不过这条路线有一个绕不开的问题:合成数据没有真实操作轨迹,标签精度不够。那就需要一整套infra管线,用算法把无标签数据打上精细标签。这解释了诺因智能极高的人才密度:全算法团队100多人中50%毕业于QS全球前30的高校。
过去的两三年里,具身智能的叙事经历了一轮转向:从遥操作采集数据训练VLA,到众说纷纭的世界模型。李银川将世界模型梳理为三个派系——视频生成、仿真和隐空间学习。按他的说法,诺因是三个派系都用了,把最优的东西融合成一整套生成式体系。
不只做大脑,诺因也在同步研发机器人本体。第一代产品X1样机已经发布:白色、简洁的苹果风格,三折叠设计,收起来仅40厘米高,类似一个扫地机。不工作时默默收纳,“从家里消失掉”。
X1目前处于样机阶段,明年量产。整机自研率95%以上,这使得诺因能把BOM成本压到行业最低之一。
李银川给具身的ChatGPT时刻下的定义很具体:当机器人走进你家里,看到一团乱的桌子,你任意下发指令,它能听懂;两个指令冲突时,它能自己权衡——“你说全屋衣服都拿去洗,但沙发上的东西不要动,沙发上有件衣服,它会怎么做?”
除了技术前沿,我跟李银川也详细聊了聊儿时的“反骨”,学生时代的创业,以及一个94年创始人对智能与家庭机器人的理解。
以下是我与李银川的对话:
刘燕秋:从小跳级,你永远比周围同学小几岁,这个经历对你影响大吗?会让你产生一种心理上的边缘感吗?
李银川:我父母都是教师,但是他们不太严格管我,还是比较尊重我的兴趣爱好发展的。基本上小学我就一直在玩吧,没有正经参加过任何辅导班学习过什么,从小也就不喜欢听课。我六年级没上,上初一天然比别人少学一年,就需要自学补齐,但我初一四次期中期末都是年级第一。由于跳级13岁高中进校是垫底的后100名,高三又考到年级第一。所以一直是在追赶,学习上更偏重自学,快速抓重点,效率会比较重要。
这对我后来影响很大,因为锻炼了我弯道超车的能力。按部就班成绩好,大家觉得你就是卷。但你有了不一样的经历,对自己的定位就天然不是标准路径。
刘燕秋:跳级是老师建议的,还是你自己要跳的?
李银川:老师肯定不会建议的,但我就比较反骨,别人都这么做的我就不想做。六年级那次有几个成绩好的同学一起跳,再往后的跳级就不太常见了。跳完级发现也还行,自己学也能学会,就把初二初三自学完,提前参加中考上了高中。从小到大比同班同学小好几岁,学的东西也跟他们不太一样。我自学钢琴、吉他、画画、摄影、编程、动画,基本都是一看一钻研就会。老师后来也知道我是这种状态,就不管了。
刘燕秋:博士期间第一次创业,契机是什么?
李银川:受我导师影响很大。上大学之后,我过得比较舒服,因为不用学语文和英语,都是我擅长的理科。我基本上考前突击就可以高分通过。参加的竞赛也没花多少时间,基本都是满分。所以我大四就被北理工校长、龙腾院士的组招过去,提前进组锻炼。我在20岁左右时进我导师的公司做了一个项目,卖了一个亿。我大四进组时他公司刚上市一两年,我看到身边一帮师兄身家都过亿了,也觉得自己能把事情做成,就会想:把一家公司做到上市,好像也没那么难?16年深度强化学习概念刚出来,17年我就把它用到金融上,我和师弟应该是全球最早做AI for finance的一批人。当时华尔街一家公司听完我们在顶会的报告,直接邀请我吃饭谈合作,我做了个软件把技术打包卖给他们,后面又聘我做了8个月高级顾问。
刘燕秋:这次一人创业的经历对你的影响是什么?
李银川:还挺关键的。一方面,这次创业改变了我后来找工作时的考量。如果不是这次创业,我可能就不会选华为研究院的 offer。因为单看薪酬待遇,相比华为天才少年计划的 offer 或者其他公司的高薪 offer,华为研究院当时给的并不是最高的。但学生期间已经创业成功过一次,我就觉得年轻时不用特别在意钱,成长更重要。
刘燕秋:那你2020年回国为什么选择去华为,而不是直接创业?
李银川:20岁我就想创业,但觉得还是太年轻,招不到很强的人。我学生时期23岁在中国想招人,难度确实很大。你想,面试的所有人都比你大,人家就算认可你,干着也不舒服。所以给自己设了十年目标,30岁下场。华为的绩效考核是不看论文的,纯看落地,我几乎都能拿绩效A,在这之外,我还会抽很多时间自己做很多研究嘛,当时定的目标是发够100篇论文去创业。在华为这五年,我把决策大模型这条主线完整走了一遍:大模型训练、代码生成、端到端自动驾驶、具身预研,大奖拿遍了,论文发了80多篇。25年,我觉得时机到了。
刘燕秋:25年的时候你是多少岁?
李银川:我是94年的,25年初已经30岁。
刘燕秋:具身这条线,23、24年大家都在讲遥操作采数据,合成数据相较于真机数据的优劣势是什么?
李银川:从数学原理上讲,大模型训练就两种范式。一种用扩散、flow matching,本质是MSE loss,去拟合人的真实轨迹,模仿人的动作。这种方式需要真实轨迹做监督,天然需要采集数据,而且会过拟合。在固定场景里把分拣做好没有问题,但那不是真的智能。真智能是能听懂人的指令,你随时打断它、纠正它,它能理解。
另一派是自回归的Transformer,把世界参数理解了输进去,通过自回归预测未来的动作,从全空间分布中采样。我们的训练信号不是人的真实轨迹,所以天然可以做合成。看到了合成数据这条线超出预期的发展,我就判断:把数据上量,按大模型的方式训具身,应该可以泛化。
刘燕秋:所以这个从根子上是说你们对于智能如何形成的理解不同。
李银川:对。一套是模仿派,一套是理解加生成,我们是大模型可泛化的这一派。
刘燕秋:但合成数据似乎一直都不算行业里特别共识的方向,大家一般都会说真机数据是金字塔的塔尖。所以现在数采的方式这块,还是在一个各说各话的阶段吗?
李银川:我们也有10%的真实数据,是ego的第一视角,只记录场景和任务,不需要完整轨迹。但从第一性原理讲,大语言模型做代码生成早就是合成数据了——一推几千行代码,根本不是人能标注的量级,全是模型自己推、自己打分、自己清洗再回流。具身同理:不通过合成解决数据量的问题,模型永远不可能做到真正可泛化的理解推理。当然合成数据有自己的难点,标签要做准、要清洗好,这需要一整套infra管线。这不是一个博士生能搞定的,所以我们人才密度很高。
刘燕秋:真机遥操路线,如果要走进家庭的话,要搞成这件事情,大概需要花多少钱?
李银川:这个真预估不出来,1000 亿起步吧,而且还不一定做得出来。我去年初的一个报告里讲过这个事情,大概测算过:都不用对标 GPT-4 的数据量级,哪怕对标 GPT-3.5 的量级,换算到具身上,再抛掉重复的数据——遥操作的数据重复率其实很高,你搬一个机器人到这个场景里建个工厂去采,采出来的很多条数据都是类似的。所以这些数据大部分不是真正能泛化的。如果真要为了涌现、为了泛化,你还得把机器人搬到每个家里去采,那得几万台机器人搬过去采集,成本会高到无法想象。所以我觉得,1000 亿起步,可能。
刘燕秋:那你看像现在海外比较火的 Sunday Robotics,他们搞的是触感手套,成本低了不少,国内好多公司也都用这种数采方案。
李银川:(因为不用真机)成本能有数量级的降幅,但也是百亿级投入 。ego centric数据这条路会更便宜一些,成本可能比真机遥操作能降个 10 倍。ego 数据再加上合成生成(比如 1:10、1:100 这种比例的生成合成),我们能把成本降低几十倍到 100 倍。
刘燕秋:现在世界模型的概念比较热也很混乱,讲讲你了解的世界模型和诺因在模型上的定位?
李银川:我们采用了一种独创的综合解决方案 ,世界模型只是其中一环。世界模型之前定义没有收敛,形成了几个派系。一类是视频生成, Seedance那派,我们做的3D视频生成就属于这类,用来生成大量逼真的第一视角操作数据;一类是仿真来的,解决sim-to-real gap,英伟达Cosmos那派,我们的高阶仿真主要用来做强化学习反馈和对齐训练;还有一类是隐空间学习世界的变化,做动作和场景变化的预测。这是我们真正训可泛化模型的内核:自回归loss加Transformer骨干,把世界参数理解了,对齐到语义,可以做原生思维链、长链条思考和指令遵从。三个派系我们都用了,融合成一整套生成式学习世界的体系。
刘燕秋:我看你之前其实有聊到过,你创业是想选一个足够大的市场,家庭具身它是一个 to C 的足够大的市场。但直接进家庭,还是先从B端开始,这道选择题,大多数人选的是后者。所以为什么你们不做toB产线,直接进家庭?
李银川:两个非共识。第一,我最擅长的是决策大模型,要发挥可泛化的能力,天然就该找最需要泛化的场景,那就是家庭。第二,我跟联创盘下来发现,机器人的售价可以做到部分人买得起。数据成本降低一百倍、模型能泛化之后,toC就通了。而且产品卖出去之后,在保护用户隐私的前提下,回流的用户反馈和报错数据可以帮助模型持续改进,形成产品和数据的飞轮。
刘燕秋:机器人进家庭的门槛到底是什么?是卡的数量还是数据量?
李银川:不是卡,卡在具身公司这儿不是瓶颈。数据量还没到那个量级,几十B的模型都吃不满。真正的门槛是:完整的可泛化模型架构的基因、合成数据的整套infra管线、千卡集群以上训练经验的人才,以及产品和模型结合的闭环。我们的整机自研率95%以上。一整套环环相扣做起来之后,才能把模型做涌现,而不是说突然拍脑子,我要砸一笔钱,模型就能涌现了。光砸钱是看不到希望的。
刘燕秋:按照你刚才讲的,机器人进家庭第一个难点是技术泛化能力不够,你觉得通过你们这一套技术路线是能够去解决这个问题。那具体来说,现在的技术距离你想要抵达那个未来,中间还差了一些什么?具身的ChatGPT时刻,你的时间表是?
李银川:我们已经摸到一些现象了,数据再扩十倍、几十倍,继续迭代,快了明年、晚了后年就会到。我对具身ChatGPT时刻的定义就是:机器人走到你家里,看到一团乱的桌子,你任意下发指令,它干什么成功率都很高,你能感受到它在用力理解你,而不是执行预先编好的程序。时间表上,一到两年开始有机器人进家庭,三到五年大幅进入,五到十年进入千万个家庭,一定会实现。
刘燕秋:也有的具身创业者说,短短两三年之内是绝对不可能进入家庭的。
李银川:那你问他机器人卖多少钱呢?50万的机器人进家庭,我也不信。
刘燕秋:家庭机器人似乎是一个还没有被充分定义的赛道,做什么不做什么,怎么决策?比如,做饭这类演示你们为什么不碰?
李银川:不是做不了,但要在全球每个家庭的真实环境里稳定做一顿饭,从买菜、洗菜、动火动刀,成功率要做到六个9、八个9,几年内、十年内都不可能。谁会真的买好菜洗好让机器人炒?做饭的过程本身是享受,痛苦的是前后的繁琐事。而且动火了,油洒了着火了怎么办?我们定位做普通家务,洗衣服成功率做到99%。
刘燕秋:你作为技术背景的一号位,过去一年在产品上学到了什么?补了哪些课?
李银川:过去一年学到了不少产品上的方法。比如,功能不是越多越好,要先把最核心的亮点做好;怎么定价、怎么定位、卖给谁,都需要到一线跟用户交流,很多需求跟我们原先想的并不一样。包括什么时候更多投入产品、什么时候更多投入模型,也都需要反复讨论和论证。
这些对我来说都是需要补的课。但我一直觉得,没做过不代表学不会,关键是愿不愿意花时间去学、去实践。今天的我跟20岁时相比,更多的差别还是这些年积累的经验和对事情的理解。做公司也一样,管理上不足的地方,自己要学,也需要优秀的伙伴一起补上。
至于对技术方向和行业的判断,就更需要长期积累,很难短时间补齐。所以对我来说,作为一号位,很重要的一件事,是结合自己的积累,对还没有形成共识的方向做出判断,再和团队一起在实践中验证、调整,努力把它做出来。
独家|前华为科学家李银川融超10亿,我跟他聊了两小时
前华为诺亚实验室科学家,投身家庭机器人。
投中网获悉,家庭具身智能公司诺因智能完成新一轮数亿元人民币融资。本轮融资由京东相关基金领投,正心谷资本、南山战新投和华登投资跟投。成立一年,诺因智能已完成5轮融资,累计融资金额超10亿元。
和创始人李银川两个多小时交流下来,我印象最深的是那个举手的故事。
刚上高一时,每当老师提问题,李银川都是班里举手最积极的同学。因为积极抢答,他被同学起了个外号,叫“现长”,爱表现的现。叫多了,到高二,李银川也不举手,那个班就彻底没有人回答老师的问题了。
再讲起这段往事,是在他成立的诺因智能。因为这段经历,他总是鼓励大家发言,在公司讲真话。“有的时候真话会得罪人嘛,比如说某个技术方向别人做了,你觉得不对,那你为了维护关系,又不说。但不说的话,大家不讨论,公司就会多走一段弯路。”
这个小故事耐人寻味。东方传统总是不鼓励人露锋芒,认为低调谦虚才是美德。但有时,谦虚多了,就成了虚伪。我们刚夸过朱啸虎真诚,这在创投圈尤为难能可贵。希望爱发言的李银川也是一个真诚的创业者。
话说回来,被盖上了“天才”戳的李银川从不是一个按部就班型的学霸。他有反骨,跳过级,创业选择的也是非共识的方向。李银川曾任职于华为的AI lab&诺亚方舟实验室,两年半即晋升为诺亚最年轻项⽬经理,离职前的身份,是华为诺亚⽣成式⼤模型⽅向负责⼈。GPT-4o的发布使他相信,合成数据将成为To C具⾝智能的重要路径。2025年,他创⽴诺因智能,聚焦消费级家庭具⾝智能机器人。
当大多数公司卷向To B产线、用确定性订单换取营收时,李银川选择的是让机器人直接进家庭。家庭场景不依赖预先编排的任务流程,要求机器人听懂任意指令、理解环境、反思纠错,是检验具身大模型是否真正具备泛化能力的终极考场。泛化的前提,是数据。在李银川看来,靠真机遥操作采集数据训不出真正的智能。诺因智能选择了一条用合成数据把数据成本降低百倍、再按大模型的方式训练具身大模型的路线。
这条路在一年前还少有人走。“不少投资人在观望,认同我们的则非常认同。”李银川告诉我。他认为自己一年前讲的每件事,现在都被慢慢证实了——无论是合成数据,自回归泛化架构还是in context learning。接下来,就是把机器人送进千家万户。
从跳级生到华为科学家
16岁考入北京理工大学,北理工与哥伦比亚大学联合培养博士,华为诺亚方舟实验室最年轻的项目经理……李银川的履历很漂亮。而这份履历的起点,是一个安徽亳州的跳级生。
小学六年级没上,初二初三跳级,15岁参加高考。连续跳级让李银川比同班同学小好几岁,也早早练就了一套“弯道超车”的自学方法论:快速抓重点、以效率取胜、不按标准路径走。
激起他创业念头的,是大学时的一段经历。大四时,李银川被北理工龙腾院士提前招入课题组,很快便帮导师的公司做成一笔价值1亿的项目。目睹导师和师兄们把公司做到上市,让李银川一下子意识到,创业不是一件遥不可及的事。
在哥大联合培养期间,他把深度强化学习用到金融上,与师弟成为全球最早做AI for finance的人之一,开发的软件卖给华尔街公司,随后受邀担任8个月高级顾问,赚的第一笔钱改变了他职业选择的权重:2020年回国,面对300万年薪的offer,他拒绝了,选择了开价并不算高的华为诺亚方舟实验室。
而创业的念头,在20岁那年就种下了。李银川给自己设了十年目标,发够100篇论文,30岁下场。
为什么用合成数据?
理解诺因智能的路线,关键在数据。
李银川将具身智能的模型训练从数学原理上分为两派:一派以VLA模仿学习为代表,底层基于扩散或flow matching,通过最小均方误差拟合人类遥操作的真实轨迹;另一派是自回归的Transformer路线,将图像、动作与语言对齐,通过自回归预测激发全空间分布采样,生成新的动作。
前者的训练信号是人的真实轨迹,它天然需要采集数据,做遥操作;后者不需要完整轨迹,只需要场景和任务的理解。诺因智能走后者——约10%的真实第一视角数据,记录人如何操作,其余通过3D视频生成大规模合成数据,在隐空间对齐语义,训练具备原生思维链推理与in context learning指令遵从能力的具身大模型。
“去年我刚创业时,合成数据的反对声音还很多,现在几乎没有人不用了。字节也开始宣传用合成数据引擎支持具身智能的发展。”李银川说。
不过这条路线有一个绕不开的问题:合成数据没有真实操作轨迹,标签精度不够。那就需要一整套infra管线,用算法把无标签数据打上精细标签。这解释了诺因智能极高的人才密度:全算法团队100多人中50%毕业于QS全球前30的高校。
过去的两三年里,具身智能的叙事经历了一轮转向:从遥操作采集数据训练VLA,到众说纷纭的世界模型。李银川将世界模型梳理为三个派系——视频生成、仿真和隐空间学习。按他的说法,诺因是三个派系都用了,把最优的东西融合成一整套生成式体系。
不只做大脑,诺因也在同步研发机器人本体。第一代产品X1样机已经发布:白色、简洁的苹果风格,三折叠设计,收起来仅40厘米高,类似一个扫地机。不工作时默默收纳,“从家里消失掉”。
X1目前处于样机阶段,明年量产。整机自研率95%以上,这使得诺因能把BOM成本压到行业最低之一。
李银川给具身的ChatGPT时刻下的定义很具体:当机器人走进你家里,看到一团乱的桌子,你任意下发指令,它能听懂;两个指令冲突时,它能自己权衡——“你说全屋衣服都拿去洗,但沙发上的东西不要动,沙发上有件衣服,它会怎么做?”
除了技术前沿,我跟李银川也详细聊了聊儿时的“反骨”,学生时代的创业,以及一个94年创始人对智能与家庭机器人的理解。
以下是我与李银川的对话:
刘燕秋:从小跳级,你永远比周围同学小几岁,这个经历对你影响大吗?会让你产生一种心理上的边缘感吗?
李银川:我父母都是教师,但是他们不太严格管我,还是比较尊重我的兴趣爱好发展的。基本上小学我就一直在玩吧,没有正经参加过任何辅导班学习过什么,从小也就不喜欢听课。我六年级没上,上初一天然比别人少学一年,就需要自学补齐,但我初一四次期中期末都是年级第一。由于跳级13岁高中进校是垫底的后100名,高三又考到年级第一。所以一直是在追赶,学习上更偏重自学,快速抓重点,效率会比较重要。
这对我后来影响很大,因为锻炼了我弯道超车的能力。按部就班成绩好,大家觉得你就是卷。但你有了不一样的经历,对自己的定位就天然不是标准路径。
刘燕秋:跳级是老师建议的,还是你自己要跳的?
李银川:老师肯定不会建议的,但我就比较反骨,别人都这么做的我就不想做。六年级那次有几个成绩好的同学一起跳,再往后的跳级就不太常见了。跳完级发现也还行,自己学也能学会,就把初二初三自学完,提前参加中考上了高中。从小到大比同班同学小好几岁,学的东西也跟他们不太一样。我自学钢琴、吉他、画画、摄影、编程、动画,基本都是一看一钻研就会。老师后来也知道我是这种状态,就不管了。
刘燕秋:博士期间第一次创业,契机是什么?
李银川:受我导师影响很大。上大学之后,我过得比较舒服,因为不用学语文和英语,都是我擅长的理科。我基本上考前突击就可以高分通过。参加的竞赛也没花多少时间,基本都是满分。所以我大四就被北理工校长、龙腾院士的组招过去,提前进组锻炼。我在20岁左右时进我导师的公司做了一个项目,卖了一个亿。我大四进组时他公司刚上市一两年,我看到身边一帮师兄身家都过亿了,也觉得自己能把事情做成,就会想:把一家公司做到上市,好像也没那么难?16年深度强化学习概念刚出来,17年我就把它用到金融上,我和师弟应该是全球最早做AI for finance的一批人。当时华尔街一家公司听完我们在顶会的报告,直接邀请我吃饭谈合作,我做了个软件把技术打包卖给他们,后面又聘我做了8个月高级顾问。
刘燕秋:这次一人创业的经历对你的影响是什么?
李银川:还挺关键的。一方面,这次创业改变了我后来找工作时的考量。如果不是这次创业,我可能就不会选华为研究院的 offer。因为单看薪酬待遇,相比华为天才少年计划的 offer 或者其他公司的高薪 offer,华为研究院当时给的并不是最高的。但学生期间已经创业成功过一次,我就觉得年轻时不用特别在意钱,成长更重要。
刘燕秋:那你2020年回国为什么选择去华为,而不是直接创业?
李银川:20岁我就想创业,但觉得还是太年轻,招不到很强的人。我学生时期23岁在中国想招人,难度确实很大。你想,面试的所有人都比你大,人家就算认可你,干着也不舒服。所以给自己设了十年目标,30岁下场。华为的绩效考核是不看论文的,纯看落地,我几乎都能拿绩效A,在这之外,我还会抽很多时间自己做很多研究嘛,当时定的目标是发够100篇论文去创业。在华为这五年,我把决策大模型这条主线完整走了一遍:大模型训练、代码生成、端到端自动驾驶、具身预研,大奖拿遍了,论文发了80多篇。25年,我觉得时机到了。
刘燕秋:25年的时候你是多少岁?
李银川:我是94年的,25年初已经30岁。
刘燕秋:具身这条线,23、24年大家都在讲遥操作采数据,合成数据相较于真机数据的优劣势是什么?
李银川:从数学原理上讲,大模型训练就两种范式。一种用扩散、flow matching,本质是MSE loss,去拟合人的真实轨迹,模仿人的动作。这种方式需要真实轨迹做监督,天然需要采集数据,而且会过拟合。在固定场景里把分拣做好没有问题,但那不是真的智能。真智能是能听懂人的指令,你随时打断它、纠正它,它能理解。
另一派是自回归的Transformer,把世界参数理解了输进去,通过自回归预测未来的动作,从全空间分布中采样。我们的训练信号不是人的真实轨迹,所以天然可以做合成。看到了合成数据这条线超出预期的发展,我就判断:把数据上量,按大模型的方式训具身,应该可以泛化。
刘燕秋:所以这个从根子上是说你们对于智能如何形成的理解不同。
李银川:对。一套是模仿派,一套是理解加生成,我们是大模型可泛化的这一派。
刘燕秋:但合成数据似乎一直都不算行业里特别共识的方向,大家一般都会说真机数据是金字塔的塔尖。所以现在数采的方式这块,还是在一个各说各话的阶段吗?
李银川:我们也有10%的真实数据,是ego的第一视角,只记录场景和任务,不需要完整轨迹。但从第一性原理讲,大语言模型做代码生成早就是合成数据了——一推几千行代码,根本不是人能标注的量级,全是模型自己推、自己打分、自己清洗再回流。具身同理:不通过合成解决数据量的问题,模型永远不可能做到真正可泛化的理解推理。当然合成数据有自己的难点,标签要做准、要清洗好,这需要一整套infra管线。这不是一个博士生能搞定的,所以我们人才密度很高。
刘燕秋:真机遥操路线,如果要走进家庭的话,要搞成这件事情,大概需要花多少钱?
李银川:这个真预估不出来,1000 亿起步吧,而且还不一定做得出来。我去年初的一个报告里讲过这个事情,大概测算过:都不用对标 GPT-4 的数据量级,哪怕对标 GPT-3.5 的量级,换算到具身上,再抛掉重复的数据——遥操作的数据重复率其实很高,你搬一个机器人到这个场景里建个工厂去采,采出来的很多条数据都是类似的。所以这些数据大部分不是真正能泛化的。如果真要为了涌现、为了泛化,你还得把机器人搬到每个家里去采,那得几万台机器人搬过去采集,成本会高到无法想象。所以我觉得,1000 亿起步,可能。
刘燕秋:那你看像现在海外比较火的 Sunday Robotics,他们搞的是触感手套,成本低了不少,国内好多公司也都用这种数采方案。
李银川:(因为不用真机)成本能有数量级的降幅,但也是百亿级投入 。ego centric数据这条路会更便宜一些,成本可能比真机遥操作能降个 10 倍。ego 数据再加上合成生成(比如 1:10、1:100 这种比例的生成合成),我们能把成本降低几十倍到 100 倍。
刘燕秋:现在世界模型的概念比较热也很混乱,讲讲你了解的世界模型和诺因在模型上的定位?
李银川:我们采用了一种独创的综合解决方案 ,世界模型只是其中一环。世界模型之前定义没有收敛,形成了几个派系。一类是视频生成, Seedance那派,我们做的3D视频生成就属于这类,用来生成大量逼真的第一视角操作数据;一类是仿真来的,解决sim-to-real gap,英伟达Cosmos那派,我们的高阶仿真主要用来做强化学习反馈和对齐训练;还有一类是隐空间学习世界的变化,做动作和场景变化的预测。这是我们真正训可泛化模型的内核:自回归loss加Transformer骨干,把世界参数理解了,对齐到语义,可以做原生思维链、长链条思考和指令遵从。三个派系我们都用了,融合成一整套生成式学习世界的体系。
刘燕秋:我看你之前其实有聊到过,你创业是想选一个足够大的市场,家庭具身它是一个 to C 的足够大的市场。但直接进家庭,还是先从B端开始,这道选择题,大多数人选的是后者。所以为什么你们不做toB产线,直接进家庭?
李银川:两个非共识。第一,我最擅长的是决策大模型,要发挥可泛化的能力,天然就该找最需要泛化的场景,那就是家庭。第二,我跟联创盘下来发现,机器人的售价可以做到部分人买得起。数据成本降低一百倍、模型能泛化之后,toC就通了。而且产品卖出去之后,在保护用户隐私的前提下,回流的用户反馈和报错数据可以帮助模型持续改进,形成产品和数据的飞轮。
刘燕秋:机器人进家庭的门槛到底是什么?是卡的数量还是数据量?
李银川:不是卡,卡在具身公司这儿不是瓶颈。数据量还没到那个量级,几十B的模型都吃不满。真正的门槛是:完整的可泛化模型架构的基因、合成数据的整套infra管线、千卡集群以上训练经验的人才,以及产品和模型结合的闭环。我们的整机自研率95%以上。一整套环环相扣做起来之后,才能把模型做涌现,而不是说突然拍脑子,我要砸一笔钱,模型就能涌现了。光砸钱是看不到希望的。
刘燕秋:按照你刚才讲的,机器人进家庭第一个难点是技术泛化能力不够,你觉得通过你们这一套技术路线是能够去解决这个问题。那具体来说,现在的技术距离你想要抵达那个未来,中间还差了一些什么?具身的ChatGPT时刻,你的时间表是?
李银川:我们已经摸到一些现象了,数据再扩十倍、几十倍,继续迭代,快了明年、晚了后年就会到。我对具身ChatGPT时刻的定义就是:机器人走到你家里,看到一团乱的桌子,你任意下发指令,它干什么成功率都很高,你能感受到它在用力理解你,而不是执行预先编好的程序。时间表上,一到两年开始有机器人进家庭,三到五年大幅进入,五到十年进入千万个家庭,一定会实现。
刘燕秋:也有的具身创业者说,短短两三年之内是绝对不可能进入家庭的。
李银川:那你问他机器人卖多少钱呢?50万的机器人进家庭,我也不信。
刘燕秋:家庭机器人似乎是一个还没有被充分定义的赛道,做什么不做什么,怎么决策?比如,做饭这类演示你们为什么不碰?
李银川:不是做不了,但要在全球每个家庭的真实环境里稳定做一顿饭,从买菜、洗菜、动火动刀,成功率要做到六个9、八个9,几年内、十年内都不可能。谁会真的买好菜洗好让机器人炒?做饭的过程本身是享受,痛苦的是前后的繁琐事。而且动火了,油洒了着火了怎么办?我们定位做普通家务,洗衣服成功率做到99%。
刘燕秋:你作为技术背景的一号位,过去一年在产品上学到了什么?补了哪些课?
李银川:过去一年学到了不少产品上的方法。比如,功能不是越多越好,要先把最核心的亮点做好;怎么定价、怎么定位、卖给谁,都需要到一线跟用户交流,很多需求跟我们原先想的并不一样。包括什么时候更多投入产品、什么时候更多投入模型,也都需要反复讨论和论证。
这些对我来说都是需要补的课。但我一直觉得,没做过不代表学不会,关键是愿不愿意花时间去学、去实践。今天的我跟20岁时相比,更多的差别还是这些年积累的经验和对事情的理解。做公司也一样,管理上不足的地方,自己要学,也需要优秀的伙伴一起补上。
至于对技术方向和行业的判断,就更需要长期积累,很难短时间补齐。所以对我来说,作为一号位,很重要的一件事,是结合自己的积累,对还没有形成共识的方向做出判断,再和团队一起在实践中验证、调整,努力把它做出来。
0
第一时间获取股权投资行业新鲜资讯和深度商业分析,请在微信公众账号中搜索投中网,或用手机扫描左侧二维码,即可获得投中网每日精华内容推送。
发表评论
全部评论