田晏林 发自 凹非寺

  量子位 | 公众号 QbitAI

  WAIC 2026落幕了,但一个信号藏不住。

  如果你逛完了全场,会发现今年具身智能的展位比去年多了将近一倍。

  人形机器人跳舞、机械臂叠衣服、双足机器人走斜坡——Demo一个比一个炫。

  但和现场的投资人、产业方多聊几句,会听到同一种疲惫:看了太多Demo,听了太多参数,真正签单进厂的,太少。

  Demo和量产之间,好像隔着一整个物理世界。

  但别丧,还是有实打实拿到订单的企业。

  在WAIC开幕前,一家专注做物理世界基础模型和解决方案的公司日冕开物,与全球服务器制造龙头&AI基础设施全栈解决方案提供商广东远图未来科技有限公司(以下简称“远图”)宣布启动超级工站战略合作。

  目标非常具体且生猛:万台级部署。

  WAIC现场,日冕展示了该超级工站的实际作业能力。

  服务器制造,是当前工业领域最具代表性的复杂装配和测试场景之一。

  一块服务器主板上,有密集排列的芯片、接口和大量精密元件。

  机器人完成上下料时,不仅要识别不同型号零件,还要保证抓取位置、力度和装配精度。

  现场工作人员介绍,为了在WAIC开幕当天完成展示,日冕团队提前进场调试。

  但由于展馆供电时间限制,真正开始调试的时间非常有限。

  设备换了环境,光照、温度、空间布局全部变化,本质上就是机器人进入了一个新场景。

  结果?

  当天下午4点半通电后,只训练了半小时,到5点钟设备就完成全部适配。

  半小时适配一个新环境。

  这背后不是简单的程序调参,而是机器人系统对于物理世界的理解能力。

  更让人意外的是,这样的训练速度和完成效果,竟然来自一家成立仅4个月的公司!(你敢信?)

  尽管日冕可能是今年WAIC展会上最年轻的企业,但却不是一支刚刚从实验室走出来的团队。

  我们查了下,其创始团队成员均是清华博士,并曾任职于蔚来、华为、智元机器人等企业,覆盖自动驾驶、AI基础模型和机器人产业化等多个方向。

  2026年,当很多人还在讲基模Scaling Law时,日冕这家刚刚成立的公司,已经在讨论产品和商业化如何Scaling了。

  机器人进厂拧螺丝,先从服务器开始

  很长一段时间,行业竞争焦点集中在世界模型、VLA、多模态大模型和参数规模。

  大家都在努力让机器人拥有更强的大脑。

  但今年WAIC上,我们发现企业关心的问题正在发生变化。

  机器人能不能适配真实工厂?

  换一个工位需要训练多久?

  面对不同型号产品,能不能快速迁移?

  部署成本能不能降下来?

  这些问题,比模型排行榜上的几个百分点更加现实。

  因为数字AI和物理AI最大的区别在于:ChatGPT完成一次训练后,可以服务数亿用户。

  但机器人不行。

  机器人必须进入具体环境,面对具体物体,完成具体动作。

  它需要理解空间变化,需要处理视觉误差,需要感知力反馈,还需要面对现实世界里的各种意外。

  物理世界不是互联网。

  没有一套数据中心,可以提前把所有情况模拟完。

  所以,具身智能下一阶段竞争的核心,不只是模型能力,而是谁能够更早进入真实场景,建立数据反馈闭环。

  服务器制造,正在成为具身智能商业化的重要试验场。

  原因很简单,这里既有足够复杂的任务,也有足够明确的工业价值。

  服务器生产涉及大量零件取放、精密装配、线缆连接、功能测试、质量检测任务。

  传统自动化设备可以解决高度固定的流程,但面对多型号、小批量、高变化生产环境,柔性能力不足。

  而AI服务器产业正在快速发展,对于制造环节提出了更高要求。

  远图所在的产业链,本身就是AI基础设施的重要组成部分。

  根据日冕介绍,远图是全球领先的服务器制造龙头,覆盖AI基础设施相关领域。

  此次合作,并不是简单部署几台机器人替代人工。

  双方真正想探索的是一套工业具身智能标准产品。

  远图的优势在于,不仅是全球服务器制造龙头,也是面向AI时代的全栈算力解决方案服务商。

  该公司不仅拥有AI服务器、通用服务器、交换机、超节点、液冷机柜等产品,还打造了业内领先的「算-网-存-管」全栈产品体系,且具备研发-供应链-制造-服务的全链条能力。

  此次和日冕合作是双方将具身智能技术与AI基础设施制造融合的全新探索。

  这样的规模制造体量,意味着双方合作一旦跑通,复制空间巨大。

  日冕的优势则是提供物理世界基础模型、机器人系统、工业级具身智能解决方案。

  一端,是远图提供真实制造场景和产业经验;

  另一端,是日冕提供物理世界基础模型、机器人系统和工业级解决方案。

  最终目标,不只是替代单个工序,而是让机器人完成从工艺理解、任务规划,到执行反馈、持续优化的完整闭环。

  不过,要让机器人真正成为生产力,实现AI自己造AI,背后的「大脑」仍是关键。

  从LaMPA到超级工站,日冕打造具身智能时代的操作系统

  日冕的「大脑」,押注的具身原生世界模型基础架构,取名LaMPA(Latent Masked Predictive Architecture)。

  之所以「超级工站」能在半小时内适应一个新环境,其背后强化学习所需的奖励函数、专家策略全部都是由这套自研基础模型直接生成。

  该模型定位很明确:通过统一跨模态隐空间学习物理世界规律。

  它不是背诵电机角度,而是理解「拿起来」这件事本身。

  当前,具身智能模型演进路线大致经历了四代:

  LLM理解文字,VLM理解视觉,VLA连接语言和动作,WAM进一步预测物理世界变化。

  但日冕认为,这四代演进本质上还是在学习表象映射,而不是理解物理规律。

  比如传统WAM侧重视觉预测、输入模态有限,容易学习表象而非物理规律。

  就像让一个人通过看窗外风景来判断室内温度,不是完全不行,但效率极低且容易出错。

  这也是日冕选择自研LaMPA世界模型的原因。

  为了最大程度上解决机器人「理解」世界的问题,LaMPA在三个维度上与市面上其他模型形成差异化:

  增加更丰富的物理表征

  传统WAM仅依托图像构建单薄视觉表征,缺少力觉、触觉、物体物理属性等关键信息,无法完整理解现实物理交互。

  LaMPA设计了Environment环境、Ego自我、Experience先验三大表征。

  Environment环境表征:让模型熟悉任意场景,负责环境重建与感知,也就是「理解」所处空间;

  Ego自我表征:统一抽象导航移动、机械操作、本体控制三大能力,让模型掌控任意本体;

  Experience先验表征:让模型具备规律认知,积累物体属性、可供性和专家知识。

  机器人当下状态=它看到的环境+对自己机身的认知+积累的物理常识。

  这是LaMPA最核心的逻辑,也是日冕认为物理世界里应该有的智能。

  大幅缩短收敛周期

  但真实世界的信息太复杂。

  为了实现上述能力,LaMPA必须大幅提升训练效率。

  传统WAM采用像素级预测,监督链路长,画面墙壁、地面等无关像素全部参与损失计算。

  冗余信息多、训练速度慢,精细操作任务适配成本极高。

  LaMPA换了思路:

  直接聚焦隐空间,仅保留任务相关信息,使用隐空间损失剔除无关环境像素,移除冗余环节缩短链路,不学习无效信息,收敛速度更快。

  简单理解,别人复习要通读整本书,它直接划考点背,省去大量无用功夫,上手速度快很多。

  LaMPA希望模型只学习有效信息,这也决定了它后续的泛化能力。

  应对多变工况容错能力更强

  传统世界动作模型WAM采用单一路径预测逻辑,每次只预判唯一一套后续操作方案。

  一旦现场出现一点点变量:光线变了、工件尺寸轻微偏差、摆放角度不一样、场地背景改动,这套唯一方案就不匹配,机器人直接操作失败、卡住无法继续干活。

  LaMPA底层用掩码扩散架构做分布预测,核心区别是:一次推理能输出多种合理、可行的交互方案,而不是只给一条路。

  换一个工厂、换一种零件、换一个机器人本体,模型仍然能够迁移。

  这正是具身智能摆脱「数据拐杖」的关键。

  但基础模型只是第一步,把它变成生产力才有价值。

  日冕不单独售卖模型,而是推出软硬一体完整落地方案。

  这次和远图合作的「超级工站」,就是典型案例。

  超级工站并不是一台机器人,而是一套软硬一体的工业智能系统。

  它由LaMPA物理世界模型、模块化机器人硬件、Workflow Agent三部分组成。

  先说Workflow Agent。

  它负责理解工艺流程,把生产SOP拆解成机器人任务,并完成方案设计、仿真验证、生产执行和反馈优化。

  第二层,是模块化机器人硬件。

  根据不同工业场景,可以组合双臂机器人、移动机器人、多机械臂和不同末端执行器。

  第三层,是LaMPA物理世界操作系统。

  它提供感知、理解、决策和控制能力。

  在强化学习阶段,日冕通过WRM世界奖励模型判断任务成功、失败或进行状态,同时通过WPM世界策略模型输出机器人动作,并将真实执行反馈持续回流,推动基础模型迭代。

  最终,一个「规划、测试、执行、反馈、进化」的闭环形成了。

  这和传统自动化最大的区别在于:

  传统自动化依靠固定代码,换产要重新编程,工况一变就停机调试,只能单点替代工位,无法自主迭代;

  超级工站依托LaMPA世界模型自适应调整,支持跨工序全局协同,能持续自主学习优化,可标准化嵌入智能产线,越运行越适配。

  具身智能进入商业Scaling阶段

  「超级工站」正在打造从生产现场到模型进化的闭环,因为具身智能真正的壁垒,不只是模型,更在于反馈闭环。

  对于数字AI来说,模型上线后可以快速复制服务用户。

  但对于物理AI来说,真正的训练,可能发生在机器人上线之后。

  每一次进入真实环境,机器人都会遇到新的问题。

  这些真实反馈,才是物理智能成长的养料。

  而具身智能真正的壁垒,也不只是模型能力,而是看谁能更早建立「反馈闭环」。

  从这个角度看,未来具身智能公司的竞争可能取决于三个指标:

  谁能更早进入真实场景

  谁能让反馈闭环速度更快

  谁能积累更大规模的真实交互数据

  这三个指标环环相扣,早进场景才能早拿数据,数据越多闭环越快,闭环越快模型进化越猛。

  没有真实场景的数据闭环,再好的基模也只是空中楼阁。

  但真实工业数据和互联网数据完全是两码事。

  互联网数据更多记录信息,而工业具身智能需要理解物理世界。

  它不仅需要视觉信息,还需要机器人操作轨迹、力觉反馈、触觉信号、工艺经验,以及最终质量结果等多维数据。

  这些数据分散在产线各个环节,采集难、标注难、治理更难。

  需要建立一套持续获取反馈、处理反馈、利用反馈的工业智能基础设施。

  为解决这一问题,日冕与远图正在建设一套覆盖采集、治理、训练和复用的工业级具身智能数据体系。

  其中,日冕自研触觉数据手套、头戴式采集设备等硬件,实现生产过程中的无感伴随式数据采集。

  但采集数据只是第一步。

  如何让这些来自真实生产现场的反馈,能够回流到模型训练体系,才是关键。

  双方建设的数据处理链路,覆盖原始数据清洗、同步对齐、多模态融合、资产化处理和模型训练,最终沉淀为操作数据集、技能库、仿真场景和模型检查点。

  这样,机器人每完成一次任务,都会产生新的经验;每一次经验,又会反过来提升下一次任务能力。

  按照规划,日冕和远图将首先在服务器制造场景验证超级工站能力,随后向更多生产环节扩展。

  2027年完成百台级部署,未来实现万台级具身智能产品部署。

  当下,越来越多的机器人告别实验室Demo,寻找产业落地机会。

  如果说PC时代,微软的成功模式是Windows作为底层操作系统,支撑Word、Excel等上层应用,从而驱动数字交互。

  Windows提供的是数字世界的感知、理解、决策、控制能力,上层应用负责具体场景的标准化执行。

  那么具身智能时代的「Windows」是什么样?

  日冕提出的方向,是WMoS(World Model as OS),世界模型即操作系统。

  底层负责理解物理世界,上层通过「超级工站」这样的行业应用完成具体任务。

  一个负责思考,一个负责行动。最终驱动机器人进入更多真实场景。

  这也是为什么服务器产线可能成为具身智能的重要转折点。

  因为这里不是展示机器人会不会走,而是在验证机器人能不能工作。

  One more thing

  模型Scaling解决的是机器人有没有大脑。

  产品Scaling解决的是机器人能不能进入真实世界。

  日冕与远图探索的超级工站,本质是在寻找一条从基础模型到工业生产的最短路径。

  未来,当机器人进入服务器工厂、半导体产线、物流中心,真正改变制造业的,可能不只是某一台机器人。

  而是一套能够持续学习、持续复制、持续进化的物理智能基础设施。