千万小时数据,泡沫有多大?
实探北京人形数据基地:当行业从'造机器人'转向'喂数据',千万小时的数据口号背后,真正的壁垒是三道质检、95%交付通过率和平台化处理能力。无本体采集与原生智能体正在改写数据规则。
人形机器人融资还在加速,产业链的焦虑却已经悄悄换了赛道——从'造得出'变成了'喂不饱'。
《科创板日报》记者实探北京人形机器人创新中心数据与训练基地后,基地负责人抛出的那句话,几乎可以当作整个行业的当头棒喝:有的机构说年底要做到千万小时,有的说无本体数据已经上千万小时——但真正的高质量数据有多少?什么是高质量?这才是最重要的。
本文的核心判断只有一句:具身智能的数据军备竞赛,正在从'比谁采得多'切换到'比谁交付得准'。泡沫在总量里,价值在通过率里。
📉 千万小时,先泼一盆冷水
金句先行:数据不是原油,堆在那儿不会自己变钱。
先看行业现状。人形机器人本体公司这两年发布节奏越来越快,融资消息隔三差五刷屏。但明眼人都能感觉到,故事的下一章已经不好写了——本体的硬件参数越来越卷,自由度、负载、续航的差距在肉眼可见地缩小。真正拉开差距的,是模型,而模型的上限,取决于数据。
于是数据量成了新的军备竞赛指标。千万小时这个口径被反复提及,但水分在哪,业内心里都有数:有的把无本体数据混着算,有的把低质量重复场景堆进去凑数。据多位接近数据侧的人士私下评价,眼下宣称的量级和真正能进训练管线的数据之间,可能差着数量级。
基地负责人的类比很直白,拿自动驾驶打比方:真正值钱的是corner case数据,特斯拉'影子模式'回流的正是这一类,而不是无论好坏把所有数据都采回来。
这背后的产业逻辑并不复杂。数据采集是重资产、重人力的活,盲目扩量意味着成本失控;而模型侧真正稀缺的,是能让策略在真实场景里落地生效的那部分数据。量的叙事好听,质的账才算得过来。当客户开始按'验证通过率'而不是'小时数'付费时,泡沫自然会被挤出。
🏭 6000平米,机器人在这里上班
金句先行:数据基地长得越来越像工厂,这恰恰是对的。
这处被称作'国家队样板间'的基地,总面积6000余平方米:一二层约5000平方米是采集与训练区,总部中心另有1000余平方米。现场搭建了家庭、商超、工业、医药康养等六大类共30多种实景场景,投入采集的机器人本体设备150多台套,另有150多套无本体采集设备——包括自研的第一人称视角头环和五自由度夹爪工装。
二楼一块约200平方米的光学动捕场地最醒目。此前在机器人运动会上包揽举重项目前四名的天工机器人,其举重、跑步、翻越障碍乃至舞蹈动作的数据,全部出自这块场地。
| 维度 | 数据 |
|---|---|
| 基地总面积 | 6000余平方米 |
| 实景场景 | 6大类、30多种 |
| 本体采集设备 | 150多台套 |
| 无本体采集设备 | 150多套 |
| 年数据产能 | 18万小时 |
| 已服务客户 | 100多家 |
生产节拍完全是工厂逻辑:采集员一天8小时,扣除摆场景、摆道具,有效录制约6小时;数据边采边传云端,夜间由自动化管线处理,第二天即可交付客户——内部称之为'7+1'交付。
目前基地数据年产能18万小时,已服务100多家客户,多为头部大模型与具身智能本体公司。负责人倒是清醒:全国现在能建数采场地的有一百多家,但中间的平台能力才是最有价值的,同质化建场并不构成壁垒。
这句'不构成壁垒'值得全行业听进去。场地是资本能买到的,平台能力是买不到的。
🔍 高质量数据,到底怎么定义?
金句先行:标准说不清,千万小时就是千万吨泡沫。
行业对'高质量数据'的争论至今没有定论。基地负责人给了一个务实到近乎冷酷的定义:最有价值的数据,是让模型在场景里能落地、产生好效果的数据。翻译过来就是——不看采集时多辛苦,只看进模型后有没有用。
为支撑这个标准,基地设了三道质检:采集后一检、标注后二检、交付算法侧验收三检。今年上半年交付一家头部客户的数据,验证通过率在95%以上。
更有意思的是标注环节的变化。过去需要数百上千人异地标注语义、动作与视频帧,如今'几张卡跑一晚上,第二天人工质检后即可交付'——标注已基本由AI接管。这意味着数据成本结构正在被重写:人力密集的标注环节被算力替代,人的角色从'生产者'退到'质检者'。
产业逻辑上,这是一个典型的'基建成熟度'信号:当数据生产开始追求通过率、周转率和单位成本,说明这个环节正在从实验室手工作坊走向工业化。而工业化,恰恰是商业化落地的前置条件。谁先把三道质检做成行业标准,谁就掌握了定价权。
🤖 无本体采集,绕开机器人的瓶颈
金句先行:最贵的采集设备,可能不是机器人。
基地采集端采取'有本体+无本体'的矩阵式方案,这可能是整个基地里最值得琢磨的技术选择。有本体采集受制于机器人本体的可靠性、续航和数量,边际成本降不下来;无本体采集则用人 wear 自研的第一人称头环和五自由度夹爪工装,直接从人类操作中抓取数据。
技术细节上,自研的手部姿态算法可捕捉人手21个关节的运动轨迹,经映射后赋能机器人灵巧手,精度达到毫米级,触觉数据同步纳入采集。人来做机器人暂时做不好的事,数据先一步进管线。
这个路线最近有了更有力的注脚。银河通用旗下全球首款原生智能体人形机器人'银河星仔'在2026年世界机器人大会(WRC)首发,上线24小时全网预订量突破200台。它搭载全自研的物理世界原生智能体与亿级参数具身大模型,与传统预设脚本机器人的最大区别在于:无需动捕或视频示范,能够直接在真实环境中通过人机交互主动学习——边看、边想、边行动。
政策端也在同步加码。工信部办公厅印发《人工智能中小企业创业支持计划(2026-2028年)》,提出三年内新培育科技和创新型中小企业1万家以上,专精特新'小巨人'企业突破2000家,并明确将数据服务列为重点支持领域。
把三件事放在一起看:数据基地在降低采集成本,原生智能体在降低数据依赖,政策在降低创业门槛——数据这道具身智能最大的瓶颈,正在被从三个方向同时凿。
⚠️ 数据壁垒,到底垒在哪?
金句先行:能被资本快速复制的,都不是壁垒。
回到开头的问题:千万小时的数据叙事,泡沫大吗?大。但它不是故事的全部。
基地负责人那句'同质化建场不构成壁垒',其实给行业划了一条清晰的分界线:场地、本体、采集员,这些是钱能解决的;场景工程能力、质检标准、自动化处理管线、跨本体的数据映射算法,这些是时间和know-how堆出来的。一百多家能建数采场地的机构里,真正具备平台能力的,掰着指头数得过来。
未来12个月可以盯三个信号:一是头部客户合同里'验证通过率'条款是否会取代'小时数'成为结算依据;二是AI标注能否把数据单位成本再压一个台阶;三是原生智能体的'自主学习'能力能在多大程度上替代离线数据采集。三个信号若同时兑现,数据叙事将彻底改写。
对创业者而言,结论也很朴素:别再拿采集量讲融资故事了,拿通过率讲。数据这门生意,最终比的不是谁采得多,而是谁交付的数据能让模型在客户场景里真的跑起来。
千万小时的口号可以喊,但决定胜负的,是那95%的通过率。