作者:彭堃方
编辑:吕鑫燚
出品:具身研习社
一只夹爪抵着箱子边缘,另一只夹爪挑起箱子,在空中翻了个面。紧接着抵箱子的夹爪摁着面单朝上的快递纸箱,送往传送带,另一只夹爪又拨过一个新的快递袋,夹起来在空中抛了个翻面...
直播到第 42 分钟,这双机械臂就分拣了1248 件。这个数字此前属于 Figure 的每小时平均记录。一小时结束,分拣数字停留在 1816 件。
8 月 12 日,自变量机器人选择用最直接的考试检验模型能力,把模型从实验室拖到直播的模拟生产线上,让它在连续运行的随机性里自己证明自己。实验室里的成功率可以挑镜头,直播不行。具身研习社全程见证了这一小时的连续作业,传送带上是没有剧本的真实快递,纸箱、泡沫袋、软包、缠胶带的异形件,面单朝向完全随机。
当然,这不是一次单纯的“秀肌肉”,其映射的是具身智能产业里少有的机会窗口——物流。
物流是很特殊的行业,它是自动化程度最高的行业之一,但它同时保留着最顽固的环节,需要由人负责把包裹变成标准。翻面单、摊平软包、摆正异形件,这些动作不需要任何技能,却因为包裹的非标属性,几十年没被任何设备替代掉。
传统自动化跨不过去,不是工程不够努力,而是路线本身有边界。为固定流程设计的设备,天然处理不了随机性。这道题的答案只能是“理解环境”而不是“执行流程”。这恰好是具身智能大模型擅长的事。
由此可见,对于具身智能而言,物流是少数“痛点、ROI、潜力空间”三者同时成立的落地场景。
而自变量的出现让这个考场多了一层意味。
这是一家此前因为家庭场景被记住的公司。家庭是具身智能公认最难的场景,环境完全非结构化,任务长尾到无法枚举。一家在攻最难场景的公司,回过头来做半结构化的物流,第一个问题自然是为什么?
答案就藏在自变量的主线中,其始终聚焦通用具身智能大模型研发,而非针对单一场景开发专用算法。通过家庭场景的高度非结构和物流场景的半结构化属性,完成对其通用大模型「能力广度 + 效率深度」的双重验证 。
更值得产业深思的是,在这场检验模型能力的实战中,自变量却选了一个结构最简单、成本最低的夹爪——这和行业其他人选择用硬件的自由度换模型容错空间的路线截然相反。
这等于把行业里心照不宣的路线分歧公开化了。机器人的产业价值,究竟由“身体”的复杂程度决定,还是由“大脑”的智能水平决定?

先看这场直播做了什么。
一小时全速连续作业,无固定脚本,无人工兜底,无故障停机,有效分拣 1816 件,准确率达到 98%。作为参照,Figure AI 在此前的公开直播中用 Figure 03 完成了 200 小时连续分拣,累计处理包裹 249,558 件,平均 1248 件 / 小时。自变量的这一小时,相当于用不到 30% 的成本,打出了比 Figure 03 高出约 45% 的效率。
比数字更值得琢磨的,是末端执行器的选择。
夹爪早就不是新鲜话题。在很多人的认知惯性里,不用五指灵巧手甚至可能被读成一种技术妥协,控制不了高自由度的手,才退回到两指夹爪。但把这件事放到产业语境,逻辑会反过来。
具身智能真正走向产业,一定要算 ROI这本账。而这本账里,末端执行器是权重很高的一项:五指灵巧手结构复杂、零部件多、精密关节需要定期校准,在 7×24 小时连续运转的仓储工况里,故障率和运维成本都是实打实的支出;标准工业夹爪结构精简、零部件少,坏了就换,极大减轻了运维负担。再往上一层看构型,双臂机械臂可以直接嵌进现有的分拣工位,不需要为 “人形” 预留通行空间和作业空间,产线改造量小,部署周期短,也更容易在多个仓之间复制。
换句话说,自变量在这场直播里回答的是一个客户会问的问题:为了完成分拣这件事,我需要为哪些硬件能力付费?人形形态、五指灵巧手所提供的那部分自由度,在这个场景里能兑换出多少额外价值?
但简化硬件本身不是难事,难的是简化之后任务还能完成。自由度从五指手降到两指夹爪,被拿掉的那部分容错空间不会凭空消失,它只会转移到模型身上,抓取点选得对不对、时机对不对、用多大力、失败了怎么补救,全部压给 “大脑”。用一副最朴素的工具去完成一件复杂的事,前提是对自己的模型有底儿。
直播里最能体现这一点的,是机器人对不同包裹的差异化策略:
搬运环节:轻质包裹直接夹取搬运,把吞吐效率拉到最高;较大、较重的箱体则采用双臂配合、侧面推移的方式,避免强行夹取造成包裹损伤或脱手。
面单整理环节:小件、轻件利用包裹自身惯性,双臂快速翻转;重件改为渐进式分步翻转,在效率和安全之间找平衡;遇到衣物这类柔性包装,先 “拨” 再 “摊” 把包裹整平,然后校准面单朝向,保证后续设备的识别准确率。
这套策略没法靠训练阶段堆规则来实现。快递件的形态组合是开放的,规则表永远追不上现实。它来自模型对物理规律的理解。这个东西大概多重,是软是硬,受力之后会怎样形变,从哪个方向施力能把它翻过来。理解之后再决策,遇到没见过的件也能给出一个合理动作。这也是自变量强调的一点:这些策略是机器人在分拣线上自己摸索、自己验证出来的,而非人工逐条指导的结果。
顺着这条线看下去,具身智能的竞争其实正在变得纯粹。构型是几条腿、末端是几根手指、外观好不好看,都是围绕场景需求做的工程选择,而不是能力本身。让大脑的归大脑,硬件回到服务场景的位置上,这可能是这场直播留给行业最直接的一句话。

自变量此前敢为人先进入家庭场景的动作,行业里还在被反复讨论,现在又开辟了物流。一个自然的疑问随之而来:这是不是不够聚焦?
把它放回自变量的技术主线里,答案会清楚很多。这家公司从一开始瞄准的就是通用具身智能大模型,而非某个场景的专用算法。对一条通用路线来说,场景并行是必然果实。只有在结构化程度不同、任务属性迥异的场景里反复验证,才能确认底层模型具备的是真正的泛化能力,而不是把一套在复杂环境中打磨得很好的 “专用能力” 误认成通用智能。
两个场景在模型迭代中承担的角色,也有明确分工。
家庭场景负责拓边界。 环境复杂多变,任务碎片化、长尾化,机器人要面对品类繁多的家务、随时改变的居家环境和自然语言交互。这类场景很难用效率指标去衡量,它的价值在于把模型的能力边界撑开,积累海量多模态任务样本,打磨环境理解、柔性执行、常识推理这些底层能力。
物流场景负责挖纵深。环境相对规整、流程标准化,但工况复杂、节拍紧张、连续作业时间长。它检验的是另一组指标,调度效率、运动精度、故障容错、7×24 小时持续作业能力。生产级任务对模型的要求是 “稳定地做对”,这与家庭场景的 “什么都能做” 构成了完全不同的压力测试。
一边是能力广度,一边是效率深度,两者合起来构成了通用大模型完整的验证场。
而物流这一侧的意义还不止于验证,把通用智能转化成可量化的产业效率,是自变量从实验室技术走向规模化商用的必经环节,也为后续切入生产制造类场景积累了工业级工程经验。
支撑这种跨场景迁移的,是模型架构层面的选择。2026 年 4 月,自变量发布了基于 “世界统一模型(WUM)架构” 的具身智能大模型 WALL‑B。与 VLA 路线拼接视觉、语言、动作模块的做法不同,WALL‑B 把视觉、语言、动作、物理预测等能力放进同一个网络中从零开始联合训练,消除模块之间的边界和数据搬运损耗。由此带来三项特性:原生多模态带来更强的空间推理能力;对物理规律的理解让它能预测环境与事件的演化;具备记忆能力,能在与环境的互动中持续进化。
回到分拣线上,这三项特性正好对应三件事,看懂一个没见过的异形件属于什么形态,预判它被夹住、被推动、被翻转之后会发生什么,以及在同一条产线上跑得越久、处理得越熟练,效率越来越高。
这也解释了自变量与传统物流机器人厂商的本质区别。后者走的是 “硬件优先、专用算法定制” 的路线:针对单一场景定制开发,换一个仓库、换一类任务就要重新调试甚至二次开发,落地周期长,迁移成本高。自变量走的是 “模型优先、通用底座赋能”,基于通用大模型,用少量样本快速适配新场景、新任务,本质是用通用智能解决场景问题。
两条路线的差别,在第一个项目上未必看得出来,从第二个、第三个项目开始会迅速拉开。当模型具备了对物理世界的通用理解能力,场景拓展就从一次次从零到一的重复研发,变成底层能力的自然外溢,边际成本和拓展速度是完全不同的量级。

物流值得被认真对待,首先因为这个市场本身的体量。
国家邮政局数据显示,2025 年中国快递业务量完成 1989.5 亿件,同比增长 13.6%,快递业务收入 1.5 万亿元;邮政行业寄递业务量合计 2165.1 亿件。折算下来,日均超过 5 亿件;在双 11 这样的峰值节点,单日业务量峰值曾达到 7.77 亿件。这些包裹里的每一件,都要在分拨中心经历上料、整理、扫码、分拣的完整流程。
与这个体量形成反差的,是一线操作岗位的供给。分拣是典型的夜班工种,工作强度大、重复度高、人员流动率高,旺季靠日薪三百多元的临时工填缺口,节后部分网点的返岗率甚至不足七成。结构性的用工矛盾,是每年都会重演的问题。
刚性自动化解决了包裹标准化之后的效率问题,人力承担了包裹标准化之前的所有随机性。这中间的空白地带,就是柔性自动化的缺口。
不需要对仓库做大规模基建改造,就能快速适配不同品类的包裹、不同的分拣流程,还能灵活应对订单的波峰波谷。自变量这套方案切进去的正是这个位置:它填的是传统刚性自动化与纯人力之间的空隙,帮物流企业在控制成本的同时提升运营弹性,而不是简单地替换掉某个工种。
从商业角度看,物流也是通用具身智能的第一个规模化变现切口。这个场景的痛点是刚性的,ROI 可以直接测算 —,省下多少人力、提升多少分拣效率、缩短多少部署周期,都是能直接反映在账面上的数字;B 端客户的付费意愿和付费能力也更强。目前自变量已与国内头部物流企业展开合作,把具身大模型和机器人引入真实的工业分拣场景。
这一步的意义在于把循环跑通:物流场景带来的营收与客户反馈,反向持续投入通用大模型研发,形成 “技术研发-场景落地-商业反哺” 的正向循环,支撑长期的技术投入。对一家做通用具身智能的公司来说,这条循环能否跑通,某种程度上决定了它能在这条长坡道上走多远。
所以物流只是一个缩影。
真正被这场直播摆到台面上的,是文章开头那个问题的答案倾向:当模型对环境的理解、对物理规律的推理、对动作的决策能力足够强,机器人就能用更简洁可靠的硬件完成更复杂的任务。决定具身智能产业价值和落地速度的关键变量,正在从 “身体” 的复杂程度,转向 “大脑” 的智能水平。
一小时的直播也许不足以直接给这个问题下定论。但当传送带上挤压的货物接连被一副两指夹爪摊平、拨正、翻好面单送走时,标尺已经悄悄换了一把。
特别声明:本文为合作媒体授权DoNews专栏转载,文章版权归原作者及原出处所有。文章系作者个人观点,不代表DoNews专栏的立场,转载请联系原作者及原出处获取授权。(有任何疑问都请联系idonews@donews.com)



