工业具身智能,为什么小模型是更现实的选择?
2026世界机器人大会近日在北京亦庄落下帷幕,今年不少企业都把演示重点放在了物料搬运、仓储分拣、上下料、拆码垛这些真实场景上。展台上更是直接复刻了汽车制造、3C电子和仓储物流的真实作业环境。从舞台炫技走向岗位实操,可以说是本届WRC最显著的变化信号,也让具身智能的商业化可行性,成为全行业集中探讨的核心议题。

产业供给端的增长数据同样亮眼。2026世界机器人大会主论坛发布的《2026年人形机器人产业发展报告》显示,2026年上半年中国人形机器人出货量已超4万台。摩根士丹利也将2026年中国人形机器人出货量预测从2.8万台上调至5万台。
不过再热闹的数据,都要经过真实场景的考验。目前来看,真正进入智能制造和仓储物流场景的人形机器人,占比仍然有限。

产量增长不等于商业化落地完成,获得订单不等于完成交付,设备进场也不等于产线常态化运行。一台具身机器人从研发原型走向生产现场,需要依次走完实验室验证、实景实训、常态部署、规模复制、商业闭环五道关口,而贯穿这五步的一个核心问题是,具身机器人到底需要什么样的“大脑”来支撑每一步的推进?
进入工业场景,需要五步才能完成
2026年6月,工业和信息化部与国务院国资委联合印发实景实训专项行动,围绕工业、服务、特种领域开放真实场景,明确提出通过真实场景训练优化具身智能模型、积累高质量真机数据,加速构建“实景实训—数据沉淀—产品迭代—规模部署”闭环。
从实验室到商业闭环的每一道关口,都是对模型能力的现实筛选。环境感知、任务规划、动作决策,这些能力决定了机器人能否在真实产线上站得住脚。越深入产线核心,垂类小模型的适配优势就越清晰。

· 实验室验证
机械臂能否抓取特定形状的工件,视觉系统能否在既定光照下识别目标,运动规划算法能否完成预设轨迹,这些都需要在实验室里被反复测试。虽然实验室可以证明机器人理论上能干什么,但无法回答在工厂复杂环境下能不能持续稳定地干活。毕竟真实场景中存在不可控的光线变化、物体差异、空间限制、人员干扰和突发情况。
· 实景实训
场景提供具体任务,企业提供硬件和算法,这一步的目的,是让机器人在真实的物料、节拍和异常面前,磨合工艺、发现问题,同时积累宝贵的真实数据。用实际运行产生新的数据,数据反过来推动模型和产品迭代。实景实训沉淀的,正是垂类小模型最缺的“燃料”。
目前来看,实验样机转入工厂实训后,任务成功率通常会出现一定回落,大量实验室不会出现的工况扰动会集中暴露。小模型训练周期短、数据需求可控、微调成本低的特征,更适配工厂快速试错的节奏。反观通用大模型,每一次场景化微调都需要巨量数据与算力投入,难以匹配产线快速迭代的现实需求。
· 常态部署
常态部署的门槛在于稳定,产线不能因为一台机器人出故障而停摆。在这一步中,产线运行会对模型提出两个硬性约束。
一是推理时延必须稳定可控,机器人从感知环境到输出动作指令的周期需要严格控制在毫秒级,一旦出现延迟抖动就会造成动作失准甚至设备碰撞。
二是结果输出必须确定可预期。通用大模型存在推理耗时长、输出存在随机性的特征。垂类小模型推理时延稳定、输出确定性高,更能适配产线对可靠性的刚性要求。
· 规模复制
可复制意味着底层技术能力和经验能够复用到多个场景,拓宽产品本身的能力边界,才能实现具身机器人大规模落地。但传统工业自动化场景长期受困于一个场景一套代码的碎片化模式,更换物料、工艺就需要重新编程调试,大幅推高项目成本与交付周期。
宇树科技创始人王兴兴在大会期间表示,行业存在一个普遍认知误区,以为把大语言模型接到机器人身上就能造出通用人形机器人。现实是语言模型只解决语义表达,人形机器人的核心诉求是物理执行。
语言模型输出的是文字,人形机器人最终输出的是每一个关节的运动指令,需要兼顾力控、速度、空间位置与环境动态变化。将语义指令转化为可靠的物理动作,正是工业垂类小模型的核心应用场景。
在规模复制阶段,垂类小模型的价值会集中释放。同一套经过工业数据打磨的轻量化模型,在工艺相近的工位之间迁移,可以显著减少重复开发工作量,帮助行业摆脱定制化项目制模式,向标准化产品化方向演进。通用大模型虽然理论上泛化能力更强,但落地到具体工业工位时,仍然需要大量场景化适配,综合成本远高于垂类模型。
· 商业闭环
规模复制的终点是商业闭环,即机器人创造的综合经济价值能够覆盖采购、调试、运维全部成本,形成可持续的商业模式。致同咨询相关分析师在WRC期间指出,技术、成本、场景是具身智能必须跨越的三座大山,18个月的投资回收期是当前市场普遍能够接受的临界点,若超过3年,客户采购意愿会大幅下降。
海外已经出现付费商用的早期探索。比如Figure 03在宝马斯帕坦堡工厂的应用。该项目采用的是“机器人即服务”(RaaS)的租赁模式,根据第三方行业机构测算,Figure 03型人形机器人的运营计费标准为约25美元/机器人·小时。相比之下,该地区汽车制造一线工人的综合用工成本约为每小时40至50美元(含薪资、福利及社保等),机器人方案在单小时成本上具备明显优势。
在正式商用之前,Figure的前代机型Figure 02已于该工厂完成了长达11个月的试点验证,累计运行约1250小时,参与搬运超过9万个零部件,并应用于3万余辆宝马X3车型的生产流程。基于这一成功试点,宝马于2026年签署了正式商用合同,初期部署40台Figure 03。
局部场景的经济性成立,不代表全行业已经跑通商业闭环。大模型的高算力硬件和云端推理费用,会直接推高单台机器人的运营成本,拉长投资回收期。而在工业场景中,客户的付费意愿锚定的是节省下来的人工成本,而不是模型参数量。小模型在算力、功耗、部署成本上的优势,让商业闭环的账更容易算平。
多条技术路线,具身智能的“大脑”之争
五步走完,每一步都把同一个问题推到台前,进入工业场景,具身机器人到底需要什么样的“大脑”?
这个问题正对应着当前产业界正在推进的几条技术路线。VLA、VLM、世界模型各有拥趸,资本热度此消彼长。
VLA(视觉-语言-动作模型)强调视觉感知与动作执行的端到端融合,VLM(视觉语言模型)侧重场景理解与任务语义解析,世界模型则被寄望于让机器人先理解物理因果再执行动作。目前,三条路线远未收敛,没有谁已经成为行业标准答案。

其中,在具身智能的技术讨论中,世界模型是绕不开的新议题。2026年更是被称为“世界模型元年”,资本热度急剧升温,英伟达、智元等企业相继发布相关产品。
世界模型的核心在于不仅要告诉机器人下一步该做什么,还能预演做了之后世界会变成什么样。相较于VLA,这是一种更完备的技术框架。
从长期看,世界模型确实是实现具身智能终局的一条可能路径,但在工业场景中,世界模型还需要面临数据类型错配、数据规模不足,以及算力、仿真与真实鸿沟等多重瓶颈。
即便拿到了数据、跨过了仿真与真实的鸿沟,想要模型真正“懂”工业物理规则,还有很长的路要走。
更值得注意的是,许多原本主打VLA路线的公司如今也纷纷宣称自己拥有世界模型,但业内连世界模型的统一定义都尚未形成。创业邦在相关报告中也直言,当前世界模型赛道的市场叙事已明显领先于技术现实。从这个角度看,世界模型尚不能被作为一条成熟路线。
再看行业讨论更久的通用大模型。通用大模型面向海量互联网文本与多模态数据训练,优势在于开放式的语义理解和通用知识,但对工业物理世界的感知与动作理解并不直接。并且,工业生产的容错空间极低,通用大模型容易出现“幻觉”风险,很有可能带来工件报废、设备磕碰甚至人员安全风险。
相比之下,垂类小模型则是参数量在数十亿甚至更少的模型,聚焦特定场景和任务进行深度优化,依托工业真实场景数据完成训练、蒸馏与微调,更加适配工厂端侧硬件环境与实时控制闭环。
聚焦特定场景、特定工序、特定物料,意味着数据需求可控、训练周期更短、部署成本更低。
有数据显示,目前70%的工业落地场景都由小模型承载。在质检、设备运维等确定性现场,小模型稳定高效、性价比突出。
行业从来不缺新概念,但对工业落地而言,概念从来不是评判标准,能不能在真实产线上稳定、低成本地完成作业,才是唯一的标尺。从技术逻辑上来看,垂类小模型在当前阶段更适合推动具身机器人落地工业场景。
首先,工业场景的工艺流程十分复杂,生产过程存在千丝万缕的因果关联,这些构成了工业独有的Know-How,很难通过训练基于互联网公开数据的通用大模型来获得。
其次,实时与可靠优先,产线对响应时延和运行稳定性要求苛刻,端侧或边缘部署的轻量化模型不依赖云端,保证机器人在任何网络环境下都能稳定工作。
再者,高质量数据存在显著缺口。训练具备强通用泛化能力的物理AI模型,需要千万小时级别的高质量真机交互数据。京东集团相关负责人在大会主论坛上表示,当前行业可用的高质量具身数据仅约十万小时量级,存在百倍缺口。在数据供给尚不足以支撑大模型训练的前提下,聚焦有限场景的垂类小模型是更务实可行的技术选择。
目前来看,不少企业正在验证这条路径。
例如,优艾智合FabriVLA便是轻量化VLA垂类模型的代表,参数量不足10亿,在抓取插装等数十项工业任务测试中,性能超越数倍于自身参数规模的模型,适配机器人端侧部署的算力条件。
擎仓机器人EVO‑1轻量化VLA模型落地欧莱雅苏州工厂,依靠垂类小模型实现三十天完成全流程部署,对比传统自动化数月的调试周期实现明显压缩。
博银合创的“博智-Bolt”工业垂类模型同样遵循这一逻辑,致力于解决工业场景中“一个场景一套代码”的碎片化难题,通过融合视觉感知、任务语义理解和机器人动作策略学习,帮助机器人在面对新物料、新工位时减少人工重新编程的工作量。

当然,强调垂类模型的现实适配性,并非意味着通用大模型、世界模型在工业场景中没有价值。更合理的产业架构是大小模型协同分层,大模型作为上层知识中枢,负责任务拆解、工艺知识库调用。底层高频实时动作控制交由垂类小模型执行。二者分工协作,而非直接用通用大模型接管机器人端侧的物理控制。
结语
回到开篇的核心问题,当前工业具身智能的落地阶段,并不需要通用大模型作为机器人的控制核心,经过工业真实数据打磨的垂类小模型,已经能够满足绝大多数工业作业的实际需求,是更适配产业节奏的技术路线。
接下来的看点,是几个明确的时间点。2026年底,专项行动将迎来万台级落地能力的验收,这是全行业的一次大考。此后,从万台级走向更大规模的复制,将成为明年的主题。而在更长的维度上,关于模型的路线之争会逐渐见分晓,垂类小模型能否在产线上持续兑现价值,将直接决定工业具身机器人商业闭环的成色。毕竟,展台的展演终将落幕,生产线才是工业具身机器人最终的考场。