百倍数据缺口!
国家发改委出手:
破解具身智能"数据饥渴"
8月28日上午10点,国家发展改革委8月份新闻发布会如期举行。面对中新社记者关于具身智能的提问,政策研究室副主任、新闻发言人李超给出了一段信息量极大的回答——其中最引人注目的,是一个此前少见于官方表述的判断:"破解具身智能训练'数据饥渴'问题"。
这是继"人工智能+"行动之后,国家层面又一次为具身智能产业划定路线图。而这一次,政策直指产业最深的痛点:不是算法不行,不是硬件不行,而是——数据不够。
01、"一年一个样":机器人从赛场冲向岗位
李超在发布会上用了一个形象的比喻:机器人"就像茁壮成长的孩子一样,一年一个样"。刚刚落幕的2026世界机器人大会上,人形机器人跑跳速度突破人类极限;第二届世界人形机器人运动会上,2000多台机器人同场竞技,赛项从首届的26项扩至51项——去年还只能比跑比跳,今年已经能打格斗、比综合运动。
更关键的信号在赛场之外:仓库分拣、野外巡检、安防值守……越来越多机器人展示了"上岗工作"的潜力。李超点出了产业的共同选择——聚焦高危有害、枯燥重复的"脏、乏、险、难"场景,"对人力难以持续胜任场景的精准补位,实现人机共融、协同提效"。
政策核心定调:
以具身智能实训场和应用中试基地为抓手,让机器人在真实场景中迭代技术、围绕真实需求形成应用闭环——"务实管用、落地见效"八个字,就是本轮政策的总基调。
02、"数据饥渴"到底有多渴?百倍缺口
"数据饥渴"不是修辞,而是这个行业最硬的瓶颈。在本届世界机器人大会主论坛上,京东集团技术委员会主席曹鹏给出了一组被反复引用的数字:训练具有泛化性的机器人大脑,需要千万小时级数据;行业目前可用的,只有十万小时量级——存在百倍缺口。
为什么大语言模型可以"吃"互联网,机器人却不行?因为具身智能需要的是物理世界的真实交互数据——人如何抓取物件、如何避障、如何在复杂环境中做决策。这些数据无法从网上下载,只能在现实中一点一滴采集。有工程师打了个比方:"我们现在训练模型,就像让一个孩子只读了一百本书就去参加高考。"
更残酷的是加工链条的损耗:10万小时原始视频,经过清洗、标注、重建,最后可用的有效数据可能只剩几千小时——百倍缺口在加工环节被进一步放大。这正是发改委此次将"构建高质量真机数据采集系统"放在要素供给第一位的原因。
表1|大语言模型 vs 具身智能:数据获取逻辑对比

03、三张"要素处方":数据、模型、标准
围绕具身智能实训场,发改委开出的处方是加强"数据、模型、标准"三大要素供给。三者环环相扣:数据是燃料,模型是引擎,标准是轨道。
数据方面,构建高质量真机数据采集系统,提升数据供给的质量与规模——这是破解"数据饥渴"的治本之策;模型方面,依托高质量数据及真实场景,支持企业开展多技术路线探索,明确鼓励视觉—语言—动作(VLA)模型、世界模型等前沿方向创新,加速技术收敛与应用落地;标准方面,建设具身智能技术标准体系,以统一标准降低模型跨本体适配成本——让一个"大脑"能装进更多"身体"。
表2|"三要素"供给路线拆解

04、两大抓手:实训场"练兵",中试基地"渡劫"
如果说实训场解决的是"在哪练、拿什么练"的问题,那么具身智能方向国家人工智能应用中试基地解决的则是"怎么从样机走向量产"的问题。李超明确了两条主线:
应用落地上,扩展具身训练场景库,鼓励行业企业开放真实场景,支持可靠性、安全性测试,加速具身智能在制造、医疗、消费、服务、公共安全五大领域落地;产业规模上,以中试基地为依托,推动整机、配套、场景企业集聚对接,带动中小企业跨越"从样机到量产"的验证门槛,形成各类企业融通发展的良性生态。
表3|具身智能实训场 vs 应用中试基地

值得注意的还有中试基地的布局逻辑:"一方向选择一地、一地聚焦一行业",由国家发改委布局、行业部委推荐、地方申报,并给予国债资金支持。目前消费领域具身智能方向的中试基地已落地杭州,宇树科技创始人王兴兴出任首席科学家——政策资源正以极快的速度向产业一线聚拢。
05、产业底座有多厚?一组数据看清基本盘

据《具身智能训练场研究报告(2026年)》,全国训练场建设已形成长三角、京津冀、珠三角三大集群,并逐步向三四线城市延伸。产业侧的动作同样密集:国务院国资委在世界机器人大会上宣布成立中央企业机器人创新联合体;小米、比亚迪等近10家主流车企已在实际产线上开展具身智能部署验证;京东则依托4000多个仓库,计划两年内采集超1000万小时人类真实场景数据——真机数据正在从"实验室奢侈品"变成"工业级基础设施"。
06、热赛道上的冷思考:防止"一哄而上"
在给出政策礼包的同时,李超也敲了警钟:机器人产业涉及人工智能、先进制造、新材料等诸多前沿技术,必须坚持因地制宜、健康有序发展,立足本地资源禀赋和产业优势,找准定位、发挥优势,"防止盲目跟风、一哄而上"。
这不是多余的提醒。宇树科技创始人王兴兴坦言,具身智能的泛化能力不足是全球行业共同面临的瓶颈——目前展示的机器人大多是"单任务专家",远非能应对千变万化的"多面手"。行业要警惕的,正是"起大早却赶不上产业应用晚集"的风险。
一句话读懂本轮政策逻辑
数据是燃料,场景是课堂,标准是轨道。实训场把"数据饥渴"变成"数据供给",中试基地把"样机表演"变成"量产交付"——从"能跑能跳"到"上岗干活",中间隔着的千万小时真实数据,正在被政策、资本与产业合力填平。
当大模型时代的数据红利趋于见顶,物理世界的数据金矿才刚刚开采。发改委此次把"真机数据"写进政策工具箱,意味着具身智能的竞争已经从"谁的算法更炫"转向"谁的数据更真、场景更多、标准更统一"。这场围绕真实世界数据的卡位战,才刚刚开始。
资料来源:国家发展改革委8月份新闻发布会(2026年8月28日)等公开信息。
上一篇:无