世界模型是否为通向AGI的必经之路,AI界尚未形成共识。部分观点认为其与智能上限无关,仅为商业路径;另一部分则坚持大语言模型无法独立实现AGI,唯有让AI理解物理世界运行规律,方能突破智能边界。
分歧持续的同时,资本加速涌入。2026年上半年,全球风险投资流向世界模型创业公司的资金已超过30亿美元。智象未来、生数科技、千寻智能等代表性企业均连续完成大额融资。
今年4月,《科创板日报》在合肥科交会上首次报道智象未来,彼时该公司刚完成超5亿元融资,并发布新一代原生全模态世界模型HiDream-O1。三个月后,智象未来接连完成三轮融资,累计融资额逾21亿元,估值跨过独角兽门槛。公司创始人梅涛是世界模型路线的坚定支持者,主张大语言模型难以独立走向AGI,因其无法指导机器与真实世界交互;真正的世界模型需具备对物理世界进行表达、建模、推理和反馈的能力。
梅涛将世界模型定义从“model the world”延伸为“mold the world”——塑造世界。他认为若AI仅复现世界,则本质仍是对人类已有知识的压缩、拟合与复刻,人类文明积累的信息量将成为模型能力边界。世界模型至少应具备三种能力:表达世界、推演世界和构造世界,即不仅生成逼真图像或视频,还需理解多模态信息间联系及场景背后的空间关系、时间变化与因果逻辑。
该判断决定智象未来技术路线:摒弃传统分立式多模态架构,采用自研UiT(Unified Transformer)统一架构,将图像像素、文本Token、视频体素、音频、动作及空间关系等信号映射至共享Token空间,在同一系统中完成理解、生成与推理。“原生全模态”被视作对人类感知方式的还原。例如人读到台风新闻时联想到狂风、雷声与温度变化,源于多感知系统协同,而非单一模态处理。
智象未来规划沿“以图入视、以视入世”路径,从图像生成向视频生成延伸,最终探索世界模型完整能力。其开源模型在Artificial Analysis文生图榜单中位列开源模型第一,闭源商用模型居全球前三。公司明确不参与通用语言模型竞争,专注视频与原生多模态方向。
当前冠以“世界模型”之名的企业存在显著差异,可粗略划分为三类:第一类从图像与视频生成切入,包括智象未来、生数科技、爱诗科技,核心挑战在于画面质量、空间关系、长时序一致性、内容可控性与生成成本;第二类聚焦具身智能基础模型,如自变量、逆矩阵,目标是通过视频、机器人数据或仿真环境学习物理世界状态变化并预测动作结果,服务于机器人感知、决策与动作生成;第三类面向机器人技能生成与动作执行,如逐际动力、跨维智能,旨在打通任务理解至真机执行链路,世界模型在此作为连接理解与执行的“技能层”,商业价值体现于机器人整机、技能方案或场景交付。
三类企业共享“理解和推演世界”的技术叙事,但产品形态、客户对象与商业化周期迥异。视频生成公司率先在内容产业变现,具身智能基础模型公司致力于构建物理世界通用能力底座,机器人技能模型公司则聚焦可落地执行的机器人动作策略。
智象未来最新15亿元C轮融资由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,系社保基金首次作为LP投资多模态大模型方向,工银资本亦为首度进入该领域。跟投方涵盖厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金等;老股东合肥产投、东方富海、金浦投资、金华金投持续加注。梅涛指出,国家级资本入场意味着长周期投入可能;影视产业资本关注内容生产方式重构;地方国资侧重区域产业生态协同。
第一类企业融资规模突出:智象未来三个月融资超21亿元、爱诗科技完成29.8亿元C轮融资、生数科技B+轮单笔5亿美元,合计逾百亿元。第二类具身智能基础模型企业独角兽密度最高,智元机器人估值150亿+、星海图200亿、智平方百亿+、银河通用百亿+、自变量投后估值亦破200亿元。第三类机器人技能企业融资阶段偏早期,公开信息有限,尚无独角兽级公司出现。
资本明显倾向“离物理世界交互更近”的方向,但对“离内容生成更近”的方向亦保持投入。一位VC内部人士称:“世界模型现在就像2010年的移动互联网,我们不知道哪个方向最终跑出,但知道不投一定会错过。”华为哈勃、小米战投等产业资本,顺为资本、红杉中国等市场化VC,社保基金、中网投、中国国新等国家队,以及杭州、厦门、湖北等多地地方国资均已布局,百亿级资金已进入赛道。这些资金能否催生技术突破、可持续商业模式,抑或仅推动估值游戏,取决于各公司能否将“世界模型”从概念转化为可交付产品。在此之前,分歧与竞速将持续并存。
免责声明:本文内容由开放的智能模型自动生成,仅供参考。



