智算多多
官方邮箱:sw@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部(邮 编:100070)


京公网安备11010602202532号 当圈内还在争论机器人何时能真正干活时,它石智航已用硬核技术,交出了答卷。
专攻干活,而且要干就干最难的。这是它石从创立之初就确立的技术路线。
它石为A1机器人选择的挑战,叫作亚毫米级线束装配任务。
这是具身智能最凶险的试金石。
采访中,丁文超拿GPT的发展脉络来做参照。
GPT-3做了两件事:把聊天场景打磨到极致,同时指明了这条Scaling曲线的走向。GPT-3出现之后,已经没人再怀疑LLM这条路。只不过GPT-3.5把它彻底引爆了。
AWE 3.0想做的,是同一个逻辑。
用线束装配对标聊天场景,把它打爆,同时验证模型在其他干活任务中的泛化能力。
丁文超坦言,做之前就清楚这是块硬骨头,但真正上手才发现,还是低估了难度。用传统方法,几乎不可能完成。
但也正是这座珠穆朗玛峰般的里程碑,催生出突破,最终汇聚成AWE 3.0。
这个世界模型最核心的特点,叫隐空间。
关键在于「隐」这个字。这是一个经过压缩和抽象的中间世界,肉眼无法直接看。
长期以来,关于具身训练数据,行业有个共识:遥操数据精度最高。丁文超却说,在亚毫米级精度的任务上,这个结论完全站不住脚。遥操作根本干不了亚毫米级的事。操作过程中会犹豫,抖动。
这是一套以人为中心的一体化数采套件。
非常轻便,一双手套,一个能够固定在胸部或头部的第一视角摄像头,完全无需像遥操那样进行专业培训,哪怕是清洁工、超市员工,佩戴上就能成为采集员,也不会影响工作。劳动者在日常工作过程中,顺手就能把数据采了,完全是“被动式”采集。
与此同时,它石发起具身数据星火计划,邀请生态伙伴加入,基于Human Centric推进具身数据标准建设、共建Human Centric数据集,构建产业级数据共享生态。该计划初期将汇聚超过1000万小时的标准化优质数据,目标推动实现1亿小时级别的数据共享。
2026年,Human Centric正在从它石率先验证的技术路线,快速演变为整个行业的共识。
具身智能的数据Scaling,这才刚刚拉开帷幕。
丁文超:硬件远比我们想象的要重要。
你可以把它理解成两头往中间靠的过程:
现在各家在追这种采集方式,投入都特别大。很多人在深入研究我们的数据采集套件。
本以为大家转弯还需要时间。没想到2026年,已经快成为以人为中心的数据采集元年了。
丁文超:两者都有,但倒逼的成分很大。
线束插接场景本身就需要达到亚毫米级精度,逼着我们去想怎么让网络动作更连续、更丝滑,怎么实现failure recovery,插错了也能局部微调重试。
这些能力,如果我们一开始选的是叠毛巾,可能永远不会被逼出来。
丁文超:真正的泛化,不只是模型本身的泛化,数据和模型的覆盖范围也要泛化。
对外聚焦线束,是因为我们想先把这个场景彻底打穿。但其实从第一天起,我们就同步在工厂、物流、仓储、洗衣房、酒店等多个场景采集数据,全部用于训练。
丁文超:去年聊这个词的时候,大家还定义不清楚。现在我可以给一个更具体的描述:准Zero-shot时代。
不是说推到一个新场景完全零基础就能上,而是你已有的核心skills,在新场景里基本都能迁移,都能用。
对标语言模型,大概相当于GPT-3的水平;如果某些任务彻底打穿,可能就到GPT-3.5了。
这个时间点比大家预想的早,说实话,也比我自己的预期快。我们规划的模型节奏是2.0、3.0、3.5、4.0,但我现在判断3.5到4.0这段还会进一步加速。
两个趋势已经肉眼可见:一是泛化数据的持续积累,二是有限数据下模型能力的快速提升。
一旦准Zero-shot成立,机器人就不只能进工厂、做一个工序,而是可能同时覆盖多个工序。C端机会也会更早涌现。
丁文超:1.0是内部版本。2.0我们有点参考GPT-2的意味。
GPT-2代表早期Scaling Law成立,并且在一些任务上已经能盖过Bert这类小模型。对我们来说,2.0意味着我们真正完成了跨本体部署,从Human Centric数据到模型训练,再到机器人上的部署,这条链路跑通了。
3.0则不仅能够看到线束场景打穿,还看到了其他若干场景的涌现;3.5是我们在其中几个场景彻底打爆。
榜单的第一。但后来大家发现,榜单的第一第二根本没意义。
具身现在正处于从第一阶段迈向第二阶段的节点。第一阶段就是现在,大家在吹各种benchmark,但你仔细深挖评测指标和评测环境,会发现偏差非常严重。
我们内部有自己的benchmark体系,用in-house数据集和公开数据集,跟业界各个SOTA模型对比,包括闭环实验。
从我们内部的横向比较看,现在能公开接触的模型,距离真正能干活的通用模型还有非常远的距离。
随着具身从垂直场景走向多场景、走向更C端,横评时代很快就会来临。
现在大家觉得具身模型的方差比较大,小模型有时候反而好,大模型反而差,根本原因是第一波红利没吃完。
数据Scaling没做扎实的时候,模型Scaling就处于一种不稳固的状态,很容易掉进局部最优,导致各种noise和方差。
但只要把数据Scaling做得足够扎实,大模型能力强于小模型,这显著减轻了问
参与进来一起迭代。
现在我们在冲刺的目标就是千万小时级别,我们想要的收益,就是把模型推到一个新任务、新地方,能以准专业的状态把任务基本完成。
丁文超:是的,我非常有信心表达这个观点。
今天我可以直接告诉大家:真实场景里无处不在的Human Centric数据,一定会带来第一波巨大的数据红利。
第二,这个模型应该是目前市面上推理速度最快的同规模模型,通过隐空间内并步动作输出的方式,输出效率可以做到十倍以上。
这一点非常反常识。大家以前觉得要实现丝滑运行,必须靠大小脑双系统,大脑低频推理,小脑高频执行,两者割裂配合。
但我们是一个模型,桥梁是隐空间里的隐变量。
丁文超:完全是实践中的认知。
我甚至觉得,具身领域将来会涌现出自己的原生基础模型。
你看现在业界所有模型,本质上都是外来户。VLA是把VLM搬过来加一个action头;world action model、video action model是把视频预测模型搬过来,再拼一个动作输出。
这些“外来和尚”在具身领域遇到的问题都很类似。
VLA的问题是泛化,到一个新场景,action需要大量新场景数据才能变好。
video action model大家现在讨论得还不多,但我可以预告一下:第一,视频预测的幻觉会影响动作质量;第二,视频预测很难维护精细的空间结构,导致模型最终还是在记动作。
原生模型可以完全避开这两个问题。我们所有数据天然就是视觉、语言、动作三种模态对齐的,训练时可以在任意模态之间互相转换。
Vision to vision是视频顶侧,Vision+language to action是端到端,Vision+language to vision+action就是世界模型。
现有的所有范式,在这套框架下得到了大一统,也没有VLM强行加action head带来的那种割裂感。
丁文超:两者结合。
丁文超:是在实操中摸出来的。我们的数据量和模型规模都是一点点往上涨,慢慢发现数据涨到一定规模,模型size就需要提升到下一个level才能继续吸收。
这个对应关系,是从自动驾驶时代积累的经验,加上具身这边数据量快速增长的实践,综合感受出来的。
丁文超:三个维度。
第一是成功率,这是一切的基准。
近八人关社会。
去年你也问过我机器人最终的形态会是什么,我当时说拟人形是大趋势。
哪怕在垂直场景有特制形态,完成动作的方式也应该贴近人,这种亲和性是人类社会的一种刚需。
你看现在大家为什么喜欢看机器人跳舞?因为它给人的感觉像自己。
展会上我们的双足机器人只要出来,现场就围得人山人海。
哪怕是从货架上抓一个水瓶,这个动作可以很机械,也可以很丝滑,给人的感官完全不同,人想要使用它、信赖它的欲望也完全不同。
所以类人性这个指标,一方面是在评价模型能力,另一方面,对于人和机器人将来真正共生,也是非常关键的一点。
我们的目标是打经济仗,在有限投入下拿最大ROI。
具身的生命周期可能比自动驾驶还要长,上面可能有若干次决战,所以弹药和粮草必须存够,每一次决战都要有主动出击的能力。
丁文超:这件事比很多人想象的要难得多。
但我觉得未来可能根本没有什么数据金字塔。你把一种数据打磨到极致,把所有细节做好,质量可能比配比来的数据要高。
丁文超:任何一个细节没做好,都会给你带来错误的结论。
Human Centric数据要做到亚毫米级精度,门槛极高。
佩戴在人身上,要把动作完整恢复出来,传感器同步、标定、云端自动化标注算法,每一个环节都不能出问题。
现在业界大多都还没搞清楚怎么把Human Centric数据做到很高精度,更不用谈后面部署到机器人上完成闭环任务。
你算一下遥操作的成本:得买一台机器人,得有数采中心或者把机器人推到现场,还得有专业遥操员。
遥操员这个行业现在慢慢兴起,但流失率很高,工作枯燥,培训一个新遥操员又要一两个月。
Human Centric完全不同。
丁文超:正确的方法论,别人终究会挤进来。与其守住硬件设备,不如把门槛真正建立在AI上。
就像大模型训练一样,大家都知道怎么训,但最终训出来的模型差异还是会体现出来,这就是不传之秘。
丁文超:与其说训练了多久,不如说是随着数据量级持续提升的一个过程。
大概时间线是这样:AWE 2.0从去年年中开始,那时候Human Centric的采集、训练、部署已经走通了。
分歧在于:有了真实数据之后,怎么高效利用?
他的路径是遥操作获取基础数据,加上大规模真机强化学习,我对这条路是有疑问的。
所以答案就是,大的方向上有共鸣:真实世界的数据才是走向泛化的金钥匙。
但怎么把数据闭环鲁棒性提升、真正走向规模化商业落地,路径是不同的。
丁文超:有这个因素,但不是全部原因。
早期Generalist这类公司还在宣传几十万小时数据,现在有些硅谷公司开始说我只需要10小时、20小时数据就够了。26、27年这个分歧会越来越明显。
但让我比较惊讶的是Generalist,作为在硅谷的公司同样坚定走Human Centric路线,而且scale在10万小时级别以上。所以环境不是决定性因素,更深层的原因可能是惯性。
丁文超:具身比自驾复杂得多,本体自由度更高,是复杂3D环境,还有大量密集的contact操作,场景丰富度也更高。根据我们现在的实践经验,具身所需的数据量至少是自动驾驶数据量级的10倍。
具身可能有三个坎:
丁文超:我们有一套自动化调度系统,每天汇总返回来的数据,check场景覆盖了哪
丁文超:人的行为实在太丰富了。越采集,越对人的行为产生敬畏。
遥操作相当于带着义肢去操作,很多人的本能行为在那个状态下都会变形。但如果直接从人身上采,你会发现人很多日常动作里藏着大量自己都没意识到的操作智慧。
最让我印象深的是failure recovery。人的精度并不是绝对的,移了1厘米还是1.5厘米其实自己不一定知道。但人的局部微调能力极强,出了问题能自然地调整修正。
动,这就是为什么大家都在追求20自由度以上。
我举个例子。我们展示的刺绣任务里有个顶针动作,夹爪很难做。缝纫工人为什么戴扳指?就是为了捏住针之后用指头把它顶过去。
夹爪只能夹,没法顶,所以用夹爪做刺绣就要绕很多弯路。这就是手的价值。
丁文超:挺有挑战的。在这么小的空间内实现这么高的自由度,技术路径本身就有争议,准直驱还是绳驱,电机设计、减速器设计……都是一点点摸索出来的。
线束场景倒逼我们把Human Centric逼到亚毫米级,而灵巧手,倒逼我们把电机和减速器的设计制造能力逼到极限。
我们应该是目前世界上屈指可数可以做到准直驱、高自由度、还能集成到人手尺寸的公司。今年ICRA(机器人国际顶会)我们会对外展示。

丁文超:线束场景里我们现在用夹爪完成的工序大概覆盖70%的任务,剩下的比如缠胶、理线,手会方便很多。
如果真的想做通用工业解决方案,绕不开灵巧手。
丁文超:六根手指,数据就对不上了。你从人身上采不到六指数据,还得自己造数据,边际效应马上就显现。
所以机器人手的自由度大概率是小于等于人手,这样才能最大化利用Human Centric数据。
丁文超:人手能做的任何动作,灵巧手都能做出来。全身人形其实现在已经基本可以做到动作模仿,手也在朝这个目标走。剩下的问题就是手脑协同。
丁文超:T是双足,A是轮式双臂。
丁文超:T是双足,A是轮式双臂。
本体层面,各家整机设计现在其实收敛了,差异没那么大。我们比较有特色的是关节。
以前大家设计关节,电机扭矩、减速比都是越大越好。但我们发现本质上是一个distribution match(分布匹配)的过程:你要让机器人执行动作的空间和流畅度,尽可能
节。
以前大家设计关节,电机扭矩、减速比都是越大越好。但我们发现本质上是一个distribution match(分布匹配)的过程:你要让机器人执行动作的空间和流畅度,尽可能贴近人的数据分布。
把这个目标拆解,整机构型大家都差不多是拟人型,真正关键的就是关节,包括末
里弥漫着汗味,工人非常忙碌。
我们也访谈了工人,他们自己干得很痛苦。插线的错误率大约是千分之三,但只要一根线插错,整条线束就要重做。
工人压力很大,流失率极高,几个月就换一批人,管理成本也居高不下。
丁文超:选了线束之后,我们没有给自己想过退路。
我觉得这一代具身智能的价值就在这儿:解决柔性、长程、高精度三者兼具的问题。
任何不满足这三个特质的场景,传统自动化都能解决,不需要具身智能。你可以沿着这个逻辑去审视市面上各家具身的落地场景。
线束通了,其他场景是能力外溢的问题。成功率、精度、柔性外溢出去,很多装配场景虽然没有线束那么极端,但也有毫米级子动作、多工序要求,我们的能力是够用的。

丁文超:大脑的量产。
以前机器人公司有量产经验的都集中在小脑,解决本体一致性、产线问题,这些路已经探得差不多了。
大脑的量产是新问题,不仅是硬件量产,还包括模型能力的量产。
比如硬件之间稍有差异,模型还得能泛化。还有一个更少人想过的问题:生命周期内的泛化。
机器人在客户现场用久了会有损耗,响应特性会变化,你的模型随着机器状态的改变,还能不能稳定工作?这个维度,现在很多人都还没考虑过。
丁文超:我们不是一家生态公司,初衷完全不同。
如果是为了做生态而做生态,你每一块都不会追求极致。但我们是真的想解决问题,还是第一性原理出发,这才驱动我们把每件事做到极限。
如果我们把自己定位成生态公司,我们没必要把减速比、自由度这些东西推到极致,能卖出去满足基本需求就行了。但这两种做法,差异性很大。
现在这个阶段,技术路径逐渐收敛,会催生硬件平台的标准化。我们现在做关节做手,某种程度上是在牵引这个标准的制定。
但这些标准在两三年内会慢慢固化,固化之后各个子部件会有更多能力外溢。
大厂下场也会加速这个过程,他们的标准化经验会推动行业收敛更快。
当前最关键的还是两件事:第一,在工厂里证明真的能干活;第二,对未来有想象力。
说实话,中国整体的大脑进展是慢于硅谷的。
中国最成熟的是本体和小脑,在大脑上有原
12 千万,大家都能达到类似水平。
虽然还有很多公司在往里冲,但问题已经收敛,只不过各家时间上滞后几个月而已。
第二,大脑时代开始了。这对行业是好事,因为人们一直低估了具身的行业价值。
以前大家的估值逻辑很粗,就是能卖多少台机器人。但一旦具身大脑真的能批量转换生产力,整个估值逻辑要重写。
我觉得大脑的引擎完全可以接住第二波增长,整体价值还会继续往上走。3+3+3,淘汰赛最终还是会来。
