切换到宽版
  • 15阅读
  • 2回复

[智能应用]具身数据一定会向头部企业收敛 [复制链接]

上一主题 下一主题
在线姜谷粉丝

UID: 1569053

精华: 2
级别: 玉清道君
 

发帖
200005
金币
801285
道行
19600
原创
770
奖券
572
斑龄
0
道券
30
获奖
0
座驾
设备
摄影级
在线时间: 25886(小时)
注册时间: 2012-06-21
最后登录: 2026-09-02
只看楼主 倒序阅读 楼主  发表于: 昨天 11:31
,上海浦东叠桥路的觅蜂数采工厂,第20000套MEgo无本体数据采集设备下线,交付给京东科技集团。同一场活动上,觅蜂宣布累计生产的无本体数据超过100万小时,并与腾讯Robotics X实验室签署无本体数据业务合作。
觅蜂今年2月成立,MEgo在6月进入量产阶段,在此后三个月里跑出来百万小时数据。
姚卯青在致辞里说,物理AI的数据电网今天立下了第一根电线杆。此后,他用近一个小时回答了一批行业内真实面对的问题:真机数采中心关停怎么看、无本体会不会取代真机、这个行业最后竞争格局会如何。
01 无本体不是替代真机
交流中的第一个问题问的是北京石景山人形机器人数采中心关闭。
姚卯青说这是个例。依据是运营得好的数采工厂仍在满负荷运转,觅蜂自己的真机采集工厂以两班倒的节奏生产数据。最近发布的蚂蚁灵波、小米、智元的Foundation Model都用了数十万小时级别的真机数据,全国数采厂加起来刚好在产这些,其中还有不少达不到标准。
两种数据的关系是分层,不是替代。
无本体数据适合预训练阶段学习通用表征,真机数据适合后训练。具体到某一个任务上做落地,绕不开对应本体的真机数据。
对另外两类数据源,他给的位置更靠后。互联网视频是现阶段的拐杖,在第一人称视角数据不够的时候只能用它获取知识和表征,无本体数据到千万小时以上规模之后可以逐渐扔掉。仿真数据在训练环节占比很小,更多用在评测,原因是成本。仿真需要购买数字资产、建模、调用GPU渲染,而随着无本体设备规模化运营,单小时真实数据的成本已经低于仿真。
觅蜂至今累计的真机数据在几十万小时量级。
02 需求收敛,行业会走向寡头
年初到现在,客户要什么变了。
姚卯青说,年初这件事还比较多样,大家在迭代、试错、收敛,拿手机、运动相机采一采也能卖。到下半年,60FPS、1080P、双目、深度这些指标逐渐成为共识,需求主要由头部客户定义出来。已经有单一客户上来就要一万套设备,国内能做到这个量产规模的公司不多。
数据标准不统一的问题,他的回答是没有解法。
一家模型公司同时用几家供应商的第一视角数据,混合训练的效果很难保证。姚卯青举了自动驾驶的例子,把ISP算法稍微改一下,从CMOS的Raw Data转成RGB图像的这一步,人眼看不出区别,模型训出来可能完全变样。神经网络对数据信号仍然敏感。
他给的唯一解法是集中采买。这也是他观察到的现状,随着几家开始起量,客户放弃了每家都采一点试试的做法,转向集中给一两家独家供。
被追问行业会不会走向寡头分布,他的回答是肯定会。
理由是投入结构。几万套设备是几亿元的量级,背后要存几百PB到上千PB数据,建一个数据中心也是几亿到十亿的投入。这个生意同时吃工程能力、运营能力和资金实力。
验收口径也在交流中被问到。姚卯青说,百万小时是去重后可以上货架售卖的有效数据。片段里的操作信息要有效,不能人在摸鱼;标称60帧的平均帧率至少要到59.98;空间提取的Handpose,做得差的是几厘米,头部客户要求7毫米,有的要5毫米,而且要能通过机械臂和灵巧手编码器读出的真值来校验。
场景分布是另一道门槛。他说很多公司手里的数据一翻全是家居和叠衣服,每个任务只有一两个小时,满足不了头部需求。
判断一家数据公司的成色,他给的答案是:盲目采100万小时不难,重复做同一个工种就可以,但几乎没有价值。要看场景覆盖的多样性,看有没有详尽的质量验证报告,最后看有多少数据被签了验收单、确认了收入。
03 从百万到亿小时,路径是众包
通往AGI需要上亿小时数据,这是姚卯青当天反复提到的量级。从100万到1亿是100倍,他说线性复制这条路走不通,需要找到方式降维打击。
答案是众包。
路径是从集中式走到半集中式,最终到全民众包式。参照物是骑手和网约车,任何人都可以参与,把自己的技能、时间和经验变成可以量化结算的东西。觅蜂已经在测试相关产品。
现在的两万套设备,一部分由觅蜂自持用于众包采集,一部分销售给海内外用户。设备已经不只在专业采集厂和BPO公司手里,社区里的退休人员和宝妈也在贡献数据产能。
无本体的运营难度高于真机数采厂。真机采集是有一片场地、搭一些场景、雇一批人就能可控完成的事情,无本体要做的是设备资产在不同场景、行业和城市之间高效流转,人员规模大得多且需要培训,还要真正进得去那些真实场景。
与上一代数据服务公司的差别也在这里。姚卯青说,Scale AI那一代的标注工作坐在电脑前就能完成,有人有一台性能不错的电脑,培训半天到一天就能上岗。物理AI的链条长得多,场景方要给你场景,进得去还要采得出,采回来还有存储、切片、标注、Handpose提取。客户要在上游一家家找供应商,是非常不友好的过程。觅蜂做的是一站式交钥匙,客户给出需求分布,交付可以直接训模型的数据。
Figure此前发布Index平台并宣布投入10亿美元。姚卯青说不清楚对方实际采集了多少小时,从公开介绍看场景偏家政,觅蜂的布局是在国内覆盖更广的场景。
数据定价目前没有标准价,取决于场景的稀缺性、进入获取的难度和交付时间要求。流通规则也还在形成,行业里有两种模式,一种出售使用权,产权仍归数据方;另一种是买断独享,觅蜂需要把数据从自己的服务器上移除。
这些都还没有定论。姚卯青对行业节奏给出的判断是,未来几年从商业化角度讲,数据是比模型本身更先实现规模化、产业化的行业。模型是开端,但定义终局的是数据。
山庄提示: 道行不够,道券不够?---☆点此充值☆
 
我有我可以
在线姜谷粉丝

UID: 1569053

精华: 2
级别: 玉清道君

发帖
200005
金币
801285
道行
19600
原创
770
奖券
572
斑龄
0
道券
30
获奖
0
座驾
设备
摄影级
在线时间: 25886(小时)
注册时间: 2012-06-21
最后登录: 2026-09-02
只看该作者 沙发  发表于: 昨天 11:32
具身智能数据正在加速向头部企业收敛,这已成为行业发展的核心趋势。这一现象主要由以下几个关键因素驱动:

一、资本加速向头部集中,形成"马太效应"
2026年以来,具身智能赛道呈现明显的资金聚集特征:

融资规模爆发:2026年至今,国内具身智能赛道已发生超200起股权融资事件,平均每天2.5起融资落地,2月和3月融资额均突破百亿元

头部玩家垄断:前20家企业拿走了超70%的融资额(约330亿元),而剩余200多家公司仅分享约124亿元,平均每家仅数千万

百亿估值俱乐部扩容:从2025年的4家迅速扩张到2026年的16家,资本用真金白银筛选出有资格参与最终决赛的"种子选手"

这种资本集中度直接导致头部企业拥有更强的数据积累能力——它们能投入更多资源搭建数据采集中心、遥操作基地和仿真平台。

二、数据壁垒:真实场景数据无法购买、无法仿造
具身智能数据与互联网AI数据有本质区别,构成了难以逾越的壁垒:

数据特性    说明
无法购买    真实物理交互数据只能通过实际部署获取
无法仿造    仿真环境难以完整复现真实世界的材料差异、接触反馈和偶发扰动
需要时间积累    来自真实作业场景的高质量数据必须通过长期部署日积月累
数据飞轮效应    模型越强→进入场景越多→产生真实数据越多→模型进化越快
截至2025年上半年,全球开源具身数据集累计时长不足1000小时,而训练真正具备泛化性的具身模型至少需要一千万小时量级的数据 。这种巨大缺口使得率先实现规模化部署的企业建立了难以追赶的先发优势。

三、头部企业的数据战略已形成差异化壁垒
1. 智平方——"正反金字塔"数据观
在国际大型双臂机器人数据集RoboCOIN中,成为half-humanoid领域数据与本体数量最多的贡献者
数据来源覆盖汽车制造、半导体、生物科技、面板制造、高端制造+智慧园区、新零售等全球最广泛的真实部署场景
攻克"灾难性遗忘"世界级难题,支持部署阶段的在线自适应
如何不发帖就快速得到金币道行
 
我有我可以
在线jjybzxw

UID: 551814


发帖
278041
金币
1157713
道行
2029
原创
2498
奖券
3895
斑龄
49
道券
1680
获奖
0
座驾
设备
摄影级
在线时间: 55310(小时)
注册时间: 2008-10-01
最后登录: 2026-09-02
只看该作者 板凳  发表于: 昨天 13:12
这篇资讯信息密度极高,涵盖了具身智能(物理AI)领域的最新里程碑、技术路线之争、行业格局演变以及未来的商业模式。为了让读者能够迅速抓住核心要点,我为您进行了专业的逻辑梳理与润色,您可以直接参考以下版本:

【润色修改版】

觅蜂科技交付第2万套设备:物理AI“数据电网”立起第一根电线杆

近日,在上海浦东的觅蜂数采工厂,第20000套MEgo无本体数据采集设备正式下线并交付京东科技集团。同日,觅蜂宣布累计生产的高质量无本体数据已突破100万小时,并与腾讯Robotics X实验室达成无本体数据业务合作。

自今年2月成立、6月MEgo进入量产以来,觅蜂仅用三个月便跑出了百万小时数据。觅蜂董事长兼CEO姚卯青表示:“物理AI的数据电网,今天立下了第一根电线杆。”围绕行业痛点,他详细解答了无本体与真机数据的关系、行业竞争格局及未来演进路径。

01 路线之争:无本体不是替代真机,而是分层互补
针对近期部分人形机器人数采中心关停的现象,姚卯青认为这只是个例。目前,运营良好的数采工厂仍在满负荷运转,且头部大模型(如蚂蚁灵波、小米、智元等)均依赖数十万小时级别的真机数据。

他强调,无本体数据与真机数据是“分层”而非“替代”关系:
无本体数据:适合预训练阶段,用于学习通用表征。
真机数据:适合后训练,在具体任务落地时,绕不开对应本体的真机数据。
互联网视频与仿真数据:互联网视频只是现阶段的“拐杖”,千万小时级无本体数据成型后可逐渐被抛弃;而仿真数据因成本高昂,目前更多用于评测环节,单小时真实数据的成本已低于仿真。

02 行业格局:需求收敛,走向寡头垄断
随着行业从试错走向成熟,客户需求已高度收敛。下半年,60FPS、1080P、双目及深度等指标成为共识,单一客户万套级设备的需求开始出现。

姚卯青指出,数据标准不统一目前没有解法。由于神经网络对数据信号极度敏感,混合多家供应商的数据极易导致模型训练效果变样。因此,“集中采买”成为唯一解法,客户正从“每家都试”转向“集中给一两家独家供”。

他预判,该行业必将走向寡头分布。几万套设备、上千PB数据存储及数据中心的建设,需要数亿至十亿级的资金投入,极度考验企业的工程、运营与资金实力。同时,判断一家数据公司的成色,不能只看“百万小时”的盲目堆砌,更要看场景覆盖的多样性、详尽的质量验证报告以及最终被验收确认收入的真实数据量。

03 破局之道:从百万到亿小时,路径是“全民众包”
通往AGI需要上亿小时的数据,线性复制走不通,必须降维打击。姚卯青给出的答案是:从集中式走向半集中式,最终实现“全民众包式”。

参照网约车和骑手模式,觅蜂正将数据采集转化为可量化结算的灵活就业。目前,2万套设备不仅部署在专业采集厂,也已进入社区,由退休人员和宝妈等群体贡献产能。

相较于上一代坐在电脑前完成标注的Scale AI模式,物理AI的数据链条极长,涉及场景准入、设备流转、存储切片及高精度Handpose提取等。觅蜂致力于提供“一站式交钥匙”服务,直接交付可训练模型的数据。

姚卯青总结道,未来几年,数据产业将比模型本身更先实现规模化与产业化。模型是开端,但定义终局的,一定是数据。
如何不发帖就快速得到金币道行
 
快速回复
限120 字节
认真回复加分,灌水扣分~
 
上一个 下一个