首页
产品服务
模型广场
Token工厂
算力市场算力商情行业资讯
注册

它石智航用“吉尼斯纪录”交卷真干活的具身大脑,丁文超:从来没有Plan B

发布日期:2026-03-26 来源:百家号作者:百家号浏览:1

真干活的具身大脑

  当圈内还在争论机器人何时能真正干活时,它石智航已用硬核技术,交出了答卷。

  专攻干活,而且要干就干最难的。这是它石从创立之初就确立的技术路线。

  它石为A1机器人选择的挑战,叫作亚毫米级线束装配任务。

  这是具身智能最凶险的试金石。

  采访中,丁文超拿GPT的发展脉络来做参照。

  GPT-3做了两件事:把聊天场景打磨到极致,同时指明了这条Scaling曲线的走向。GPT-3出现之后,已经没人再怀疑LLM这条路。只不过GPT-3.5把它彻底引爆了。

  AWE 3.0想做的,是同一个逻辑。

  用线束装配对标聊天场景,把它打爆,同时验证模型在其他干活任务中的泛化能力。

  丁文超坦言,做之前就清楚这是块硬骨头,但真正上手才发现,还是低估了难度。用传统方法,几乎不可能完成。

  但也正是这座珠穆朗玛峰般的里程碑,催生出突破,最终汇聚成AWE 3.0。

隐空间:世界模型的核心

  这个世界模型最核心的特点,叫隐空间。

  关键在于「隐」这个字。这是一个经过压缩和抽象的中间世界,肉眼无法直接看。

以人为中心的数据采集

  长期以来,关于具身训练数据,行业有个共识:遥操数据精度最高。丁文超却说,在亚毫米级精度的任务上,这个结论完全站不住脚。遥操作根本干不了亚毫米级的事。操作过程中会犹豫,抖动。

  这是一套以人为中心的一体化数采套件。

  非常轻便,一双手套,一个能够固定在胸部或头部的第一视角摄像头,完全无需像遥操那样进行专业培训,哪怕是清洁工、超市员工,佩戴上就能成为采集员,也不会影响工作。劳动者在日常工作过程中,顺手就能把数据采了,完全是“被动式”采集。

与此同时,它石发起具身数据星火计划,邀请生态伙伴加入,基于Human Centric推进具身数据标准建设、共建Human Centric数据集,构建产业级数据共享生态。该计划初期将汇聚超过1000万小时的标准化优质数据,目标推动实现1亿小时级别的数据共享。

  2026年,Human Centric正在从它石率先验证的技术路线,快速演变为整个行业的共识。

  具身智能的数据Scaling,这才刚刚拉开帷幕。

对话原文

量子位:A1刷新线束装配吉尼斯世界纪录令人印象深刻,研发过程中有什么挑战?哪些环节比预想的要难?

  丁文超:硬件远比我们想象的要重要。

  你可以把它理解成两头往中间靠的过程:

  • 题,但我们解决得还不错。
  • 第二,端到端网络到底能做到什么精度?之前我们心里的答案是毫米级,但最近有了新突破,我们能做到亚毫米级。
  • 这也是个反常识。大家一直觉得端到端网络特别依赖数据驱动,精度上是不是不如传统方法?事实证明不是。
  • 还有第三点,以人为中心的生态扩展,比我预想的快得多。

  现在各家在追这种采集方式,投入都特别大。很多人在深入研究我们的数据采集套件。

  本以为大家转弯还需要时间。没想到2026年,已经快成为以人为中心的数据采集元年了。

量子位:亚毫米级这个目标,是你们在实践中发现可以做到,还是场景本身倒逼出来

  丁文超:两者都有,但倒逼的成分很大。

  线束插接场景本身就需要达到亚毫米级精度,逼着我们去想怎么让网络动作更连续、更丝滑,怎么实现failure recovery,插错了也能局部微调重试。

  这些能力,如果我们一开始选的是叠毛巾,可能永远不会被逼出来。

量子位:那现在已经实现了亚毫米级操作,如果让模型去叠毛巾,需要重新学习吗?

  丁文超:真正的泛化,不只是模型本身的泛化,数据和模型的覆盖范围也要泛化。

  对外聚焦线束,是因为我们想先把这个场景彻底打穿。但其实从第一天起,我们就同步在工厂、物流、仓储、洗衣房、酒店等多个场景采集数据,全部用于训练。

量子位:具身智能的GPT时刻,怎么定义?

  丁文超:去年聊这个词的时候,大家还定义不清楚。现在我可以给一个更具体的描述:准Zero-shot时代。

  不是说推到一个新场景完全零基础就能上,而是你已有的核心skills,在新场景里基本都能迁移,都能用。

  对标语言模型,大概相当于GPT-3的水平;如果某些任务彻底打穿,可能就到GPT-3.5了。

  这个时间点比大家预想的早,说实话,也比我自己的预期快。我们规划的模型节奏是2.0、3.0、3.5、4.0,但我现在判断3.5到4.0这段还会进一步加速。

  两个趋势已经肉眼可见:一是泛化数据的持续积累,二是有限数据下模型能力的快速提升。

  一旦准Zero-shot成立,机器人就不只能进工厂、做一个工序,而是可能同时覆盖多个工序。C端机会也会更早涌现。

量子位:AWE 2.0意味着什么?

  丁文超:1.0是内部版本。2.0我们有点参考GPT-2的意味。

  GPT-2代表早期Scaling Law成立,并且在一些任务上已经能盖过Bert这类小模型。对我们来说,2.0意味着我们真正完成了跨本体部署,从Human Centric数据到模型训练,再到机器人上的部署,这条链路跑通了。

  3.0则不仅能够看到线束场景打穿,还看到了其他若干场景的涌现;3.5是我们在其中几个场景彻底打爆。

  榜单的第一。但后来大家发现,榜单的第一第二根本没意义。

  具身现在正处于从第一阶段迈向第二阶段的节点。第一阶段就是现在,大家在吹各种benchmark,但你仔细深挖评测指标和评测环境,会发现偏差非常严重。

  我们内部有自己的benchmark体系,用in-house数据集和公开数据集,跟业界各个SOTA模型对比,包括闭环实验。

  从我们内部的横向比较看,现在能公开接触的模型,距离真正能干活的通用模型还有非常远的距离。

  随着具身从垂直场景走向多场景、走向更C端,横评时代很快就会来临。

量子位:具身智能的Scaling Law,好像跟当年GPT引发的风潮不太一样。GPT时代越做越大,但具身领域却出现了做得更小更精的方向,你怎么看?

  现在大家觉得具身模型的方差比较大,小模型有时候反而好,大模型反而差,根本原因是第一波红利没吃完。

  数据Scaling没做扎实的时候,模型Scaling就处于一种不稳固的状态,很容易掉进局部最优,导致各种noise和方差。

  但只要把数据Scaling做得足够扎实,大模型能力强于小模型,这显著减轻了问

  参与进来一起迭代。

  现在我们在冲刺的目标就是千万小时级别,我们想要的收益,就是把模型推到一个新任务、新地方,能以准专业的状态把任务基本完成。

量子位:所以数据Scaling Law没有兑现,也就证明了仿真合成数据、遥操作数据这条路走不通?

  丁文超:是的,我非常有信心表达这个观点。

  今天我可以直接告诉大家:真实场景里无处不在的Human Centric数据,一定会带来第一波巨大的数据红利。

全球首个能干活的具身超级大脑AWE3.0诞生

  第二,这个模型应该是目前市面上推理速度最快的同规模模型,通过隐空间内并步动作输出的方式,输出效率可以做到十倍以上。

  这一点非常反常识。大家以前觉得要实现丝滑运行,必须靠大小脑双系统,大脑低频推理,小脑高频执行,两者割裂配合。

  但我们是一个模型,桥梁是隐空间里的隐变量。

量子位:隐空间内的动作输出,是一开始就设计好的,还是实践中摸索出来的?

  丁文超:完全是实践中的认知。

  我甚至觉得,具身领域将来会涌现出自己的原生基础模型。

  你看现在业界所有模型,本质上都是外来户。VLA是把VLM搬过来加一个action头;world action model、video action model是把视频预测模型搬过来,再拼一个动作输出。

  这些“外来和尚”在具身领域遇到的问题都很类似。

  VLA的问题是泛化,到一个新场景,action需要大量新场景数据才能变好。

  video action model大家现在讨论得还不多,但我可以预告一下:第一,视频预测的幻觉会影响动作质量;第二,视频预测很难维护精细的空间结构,导致模型最终还是在记动作。

  原生模型可以完全避开这两个问题。我们所有数据天然就是视觉、语言、动作三种模态对齐的,训练时可以在任意模态之间互相转换。

  Vision to vision是视频顶侧,Vision+language to action是端到端,Vision+language to vision+action就是世界模型。

  现有的所有范式,在这套框架下得到了大一统,也没有VLM强行加action head带来的那种割裂感。

量子位:你说VLM、video action model会遇到这些问题,是思想实验,还是你们真的踩过坑?

  丁文超:两者结合。

量子位:当前的模型规模,是数据量决定了它,还是先定了规模再去配数据?

  丁文超:是在实操中摸出来的。我们的数据量和模型规模都是一点点往上涨,慢慢发现数据涨到一定规模,模型size就需要提升到下一个level才能继续吸收。

  这个对应关系,是从自动驾驶时代积累的经验,加上具身这边数据量快速增长的实践,综合感受出来的。

量子位:你们内部评价模型好坏的标准是什么?

  丁文超:三个维度。

  第一是成功率,这是一切的基准。

  近八人关社会。

  去年你也问过我机器人最终的形态会是什么,我当时说拟人形是大趋势。

  哪怕在垂直场景有特制形态,完成动作的方式也应该贴近人,这种亲和性是人类社会的一种刚需。

  你看现在大家为什么喜欢看机器人跳舞?因为它给人的感觉像自己。

  展会上我们的双足机器人只要出来,现场就围得人山人海。

  哪怕是从货架上抓一个水瓶,这个动作可以很机械,也可以很丝滑,给人的感官完全不同,人想要使用它、信赖它的欲望也完全不同。

  所以类人性这个指标,一方面是在评价模型能力,另一方面,对于人和机器人将来真正共生,也是非常关键的一点。

量子位:训练成本对一家创业公司来说,压力大吗?

  我们的目标是打经济仗,在有限投入下拿最大ROI。

  具身的生命周期可能比自动驾驶还要长,上面可能有若干次决战,所以弹药和粮草必须存够,每一次决战都要有主动出击的能力。

支撑具身智能的基石,超级数据范式Human Centric

量子位:数据质量的把控,你们是怎么做的?

  丁文超:这件事比很多人想象的要难得多。

  但我觉得未来可能根本没有什么数据金字塔。你把一种数据打磨到极致,把所有细节做好,质量可能比配比来的数据要高。

量子位:那为什么此前行业里会形成数据金字塔这样的共识?

  丁文超:任何一个细节没做好,都会给你带来错误的结论。

  Human Centric数据要做到亚毫米级精度,门槛极高。

  佩戴在人身上,要把动作完整恢复出来,传感器同步、标定、云端自动化标注算法,每一个环节都不能出问题。

  现在业界大多都还没搞清楚怎么把Human Centric数据做到很高精度,更不用谈后面部署到机器人上完成闭环任务。

  你算一下遥操作的成本:得买一台机器人,得有数采中心或者把机器人推到现场,还得有专业遥操员。

  遥操员这个行业现在慢慢兴起,但流失率很高,工作枯燥,培训一个新遥操员又要一两个月。

  Human Centric完全不同。

量子位:城河吗?

  丁文超:正确的方法论,别人终究会挤进来。与其守住硬件设备,不如把门槛真正建立在AI上。

  就像大模型训练一样,大家都知道怎么训,但最终训出来的模型差异还是会体现出来,这就是不传之秘。

量子位:线束这个模型,大概学习了多久?

  丁文超:与其说训练了多久,不如说是随着数据量级持续提升的一个过程。

  大概时间线是这样:AWE 2.0从去年年中开始,那时候Human Centric的采集、训练、部署已经走通了。

  分歧在于:有了真实数据之后,怎么高效利用?

  他的路径是遥操作获取基础数据,加上大规模真机强化学习,我对这条路是有疑问的。

  所以答案就是,大的方向上有共鸣:真实世界的数据才是走向泛化的金钥匙。

  但怎么把数据闭环鲁棒性提升、真正走向规模化商业落地,路径是不同的。

量子位:这种路径差异,会不会有中国与硅谷环境不同的原因?中国有更丰富的人力资源,所以可以做Human Centric采集。

  丁文超:有这个因素,但不是全部原因。

  早期Generalist这类公司还在宣传几十万小时数据,现在有些硅谷公司开始说我只需要10小时、20小时数据就够了。26、27年这个分歧会越来越明显。

  但让我比较惊讶的是Generalist,作为在硅谷的公司同样坚定走Human Centric路线,而且scale在10万小时级别以上。所以环境不是决定性因素,更深层的原因可能是惯性。

量子位:达到什么样的数据量级,才能支撑到你们说的4.0水平?

  丁文超:具身比自驾复杂得多,本体自由度更高,是复杂3D环境,还有大量密集的contact操作,场景丰富度也更高。根据我们现在的实践经验,具身所需的数据量至少是自动驾驶数据量级的10倍。

  具身可能有三个坎:

  1. 10万小时是模型能力不错;
  2. 100万小时是准产品级,可以deliver给各种用户;
  3. 1000万小时之后,数据Scaling law的讨论会变少,大家开始讨论模型架构,前沿公司开始做强化学习。

量子位:具身的数据采集比自动驾驶复杂得多,你们怎么保证采集质量和覆盖度?

  丁文超:我们有一套自动化调度系统,每天汇总返回来的数据,check场景覆盖了哪

  丁文超:人的行为实在太丰富了。越采集,越对人的行为产生敬畏。

  遥操作相当于带着义肢去操作,很多人的本能行为在那个状态下都会变形。但如果直接从人身上采,你会发现人很多日常动作里藏着大量自己都没意识到的操作智慧。

  最让我印象深的是failure recovery。人的精度并不是绝对的,移了1厘米还是1.5厘米其实自己不一定知道。但人的局部微调能力极强,出了问题能自然地调整修正。

  动,这就是为什么大家都在追求20自由度以上。

  我举个例子。我们展示的刺绣任务里有个顶针动作,夹爪很难做。缝纫工人为什么戴扳指?就是为了捏住针之后用指头把它顶过去。

  夹爪只能夹,没法顶,所以用夹爪做刺绣就要绕很多弯路。这就是手的价值。

量子位:灵巧手研发难度怎么样?

  丁文超:挺有挑战的。在这么小的空间内实现这么高的自由度,技术路径本身就有争议,准直驱还是绳驱,电机设计、减速器设计……都是一点点摸索出来的。

  线束场景倒逼我们把Human Centric逼到亚毫米级,而灵巧手,倒逼我们把电机和减速器的设计制造能力逼到极限。

  我们应该是目前世界上屈指可数可以做到准直驱、高自由度、还能集成到人手尺寸的公司。今年ICRA(机器人国际顶会)我们会对外展示。

灵巧手展示
灵巧手展示

量子位:灵巧手解决之后,会解锁哪些场景?

  丁文超:线束场景里我们现在用夹爪完成的工序大概覆盖70%的任务,剩下的比如缠胶、理线,手会方便很多。

  如果真的想做通用工业解决方案,绕不开灵巧手。

量子位:为什么机器人手都做五根手指,不做六根七根?

  丁文超:六根手指,数据就对不上了。你从人身上采不到六指数据,还得自己造数据,边际效应马上就显现。

  所以机器人手的自由度大概率是小于等于人手,这样才能最大化利用Human Centric数据。

量子位:手的终极目标是什么?

  丁文超:人手能做的任何动作,灵巧手都能做出来。全身人形其实现在已经基本可以做到动作模仿,手也在朝这个目标走。剩下的问题就是手脑协同。

量子位:你们有A和T两个系列,各自的优势是什么?

  丁文超:T是双足,A是轮式双臂。

  丁文超:T是双足,A是轮式双臂。

  本体层面,各家整机设计现在其实收敛了,差异没那么大。我们比较有特色的是关节。

  以前大家设计关节,电机扭矩、减速比都是越大越好。但我们发现本质上是一个distribution match(分布匹配)的过程:你要让机器人执行动作的空间和流畅度,尽可能

  节。

  以前大家设计关节,电机扭矩、减速比都是越大越好。但我们发现本质上是一个distribution match(分布匹配)的过程:你要让机器人执行动作的空间和流畅度,尽可能贴近人的数据分布。

  把这个目标拆解,整机构型大家都差不多是拟人型,真正关键的就是关节,包括末

  里弥漫着汗味,工人非常忙碌。

  我们也访谈了工人,他们自己干得很痛苦。插线的错误率大约是千分之三,但只要一根线插错,整条线束就要重做。

  工人压力很大,流失率极高,几个月就换一批人,管理成本也居高不下。

量子位:你们有没有计划?,你说或来交给她张杨家!

  丁文超:选了线束之后,我们没有给自己想过退路。

  我觉得这一代具身智能的价值就在这儿:解决柔性、长程、高精度三者兼具的问题。

  任何不满足这三个特质的场景,传统自动化都能解决,不需要具身智能。你可以沿着这个逻辑去审视市面上各家具身的落地场景。

  线束通了,其他场景是能力外溢的问题。成功率、精度、柔性外溢出去,很多装配场景虽然没有线束那么极端,但也有毫米级子动作、多工序要求,我们的能力是够用的。

线束装配场景
线束装配场景

量子位:批量化落地的核心挑战是什么?

  丁文超:大脑的量产。

  以前机器人公司有量产经验的都集中在小脑,解决本体一致性、产线问题,这些路已经探得差不多了。

  大脑的量产是新问题,不仅是硬件量产,还包括模型能力的量产。

  比如硬件之间稍有差异,模型还得能泛化。还有一个更少人想过的问题:生命周期内的泛化。

  机器人在客户现场用久了会有损耗,响应特性会变化,你的模型随着机器状态的改变,还能不能稳定工作?这个维度,现在很多人都还没考虑过。

量子位:你们做了数据、模型、本体、关节、灵巧手,每一块拆开都能做一家独角兽,你们怎么定位自己?

  丁文超:我们不是一家生态公司,初衷完全不同。

  如果是为了做生态而做生态,你每一块都不会追求极致。但我们是真的想解决问题,还是第一性原理出发,这才驱动我们把每件事做到极限。

  如果我们把自己定位成生态公司,我们没必要把减速比、自由度这些东西推到极致,能卖出去满足基本需求就行了。但这两种做法,差异性很大。

量子位:随着规模变大,你们怎么平衡敏捷和复杂度?

  现在这个阶段,技术路径逐渐收敛,会催生硬件平台的标准化。我们现在做关节做手,某种程度上是在牵引这个标准的制定。

  但这些标准在两三年内会慢慢固化,固化之后各个子部件会有更多能力外溢。

  大厂下场也会加速这个过程,他们的标准化经验会推动行业收敛更快。

  当前最关键的还是两件事:第一,在工厂里证明真的能干活;第二,对未来有想象力。

大脑时代开启,它石已让具身智能真干活

丁文超:具身大脑上的竞争激烈度会上升得

  说实话,中国整体的大脑进展是慢于硅谷的。

  中国最成熟的是本体和小脑,在大脑上有原

  12 千万,大家都能达到类似水平。

  虽然还有很多公司在往里冲,但问题已经收敛,只不过各家时间上滞后几个月而已。

  第二,大脑时代开始了。这对行业是好事,因为人们一直低估了具身的行业价值。

  以前大家的估值逻辑很粗,就是能卖多少台机器人。但一旦具身大脑真的能批量转换生产力,整个估值逻辑要重写。

  我觉得大脑的引擎完全可以接住第二波增长,整体价值还会继续往上走。3+3+3,淘汰赛最终还是会来。

量子位:你们希望外界给你们贴什么标签?

本文转载自百家号, 作者:百家号, 原文标题:《 它石智航用“吉尼斯纪录”交卷真干活的具身大脑,丁文超:从来没有Plan B 》, 原文链接: https://baijiahao.baidu.com/s?id=1860691383624805388&wfr=spider&for=pc。 本平台仅做分享和推荐,不涉及任何商业用途。文章版权归原作者所有。如涉及作品内容、版权和其它问题,请与我们联系,我们将在第一时间删除内容!
本文相关推荐
暂无相关推荐
点击立即订阅