9月1日,影眸科技Hyper3D正式发布世界生成模型WorldGen。该模型基于其在国际图形学顶会SIGGRAPH 2025荣获最佳论文的场景级生成技术CAST,将3D生成从单个物体推进至完整场景,重点解决遮挡补全、空间对齐及物体间物理关系建模问题。
WorldGen以一张普通照片为输入,首先识别图像中所有物体,继而分别补全被遮挡部分,生成独立的3D模型,恢复真实尺寸、相对位置及物理关系(如支撑、悬挂、接触),最终重构为结构成立、可运行的三维空间。生成结果中,每件物体保持语义与几何独立性:桌子、杯子、椅子均可被单独选中、移动、替换、编辑,并天然支持碰撞体、质量、摩擦等物理属性赋值。
区别于传统3D生成仅输出整体不可拆分的‘转着看’式模型,WorldGen强调‘可编辑性’与‘可运行性’。生成的3D场景可直接导入NVIDIA Isaac Sim、Unity、Unreal Engine、PlayCanvas及团结引擎等主流仿真与实时渲染平台;具身智能团队可用于机械臂抓取训练;游戏开发者可接入Blender等DCC工具进行材质调整、动画绑定与关卡编辑;影视创作者可在其中固定机位、调度镜头,再交由Seedance 2.5等视频模型完成光影与风格渲染;XR设备用户亦可进入该空间进行沉浸式交互。
技术演进路径清晰:影眸Hyper3D成立于2020年,核心团队源自上海科技大学。其首代产品Hyper3D Rodin为原生3D大模型,专注单物体生成,已服务全球近千万用户,客户包括Lowe's、字节跳动、拓竹及Unity中国;Rodin的技术基础为2024年获SIGGRAPH最佳论文提名的CLAY框架,该框架确立了直接使用3D数据训练的原生3D生成范式,推动行业转向此技术路线。
在单物体生成持续迭代基础上,团队提出‘向内’与‘向外’双路径探索:‘向内’指资产递归分件(BANG功能),如将整车拆解为车身、车轮、内饰;‘向外’即扩展至多物体协同空间建模,对应CAST研究及本次发布的WorldGen。CAST管线包含五阶段处理:物体与深度识别、支撑/悬挂关系解析、遮挡补全、位姿与朝向恢复、物理校正(减少穿模与悬浮)。WorldGen继承并工程化全部能力,同时引入混合表达设计——背景采用3D Gaussian Splatting兼顾视觉完整性与渲染效率,关键可交互物体则直接生成带物理属性的独立Mesh。
物理属性估计是WorldGen关键增强:系统结合物体体积、环境上下文与空间关系,通过视觉语言模型与传统算法联合推断质量、摩擦系数、碰撞体形状等参数;虽需在目标仿真环境(如Isaac Sim)中进一步校验,但已实现刚体级Sim-Ready能力,并规划逐步支持关节体(抽屉、柜门)、柔性体(衣物)及流体生成,最终覆盖全物理对象类型。
从研究到产品历时约一年,主因在于工程稳定性提升。CAST作为论文原型,模块串联成功率受误差累积影响显著;WorldGen则重构底层流程、削减冗余模块,确保每次生成均具备生产可用性。视觉可信、结构成立、物理可用构成三层递进门槛,WorldGen着力突破后两者。
应用落地已形成闭环:2024年7月,影眸Hyper3D联合地瓜机器人、谋先飞发布‘具身智能可训练仿真闭环联合解决方案’,WorldGen负责生成带物理属性的可变体3D场景;谋先飞适配MotrixSim完成Sim-Ready构建;地瓜机器人提供算力与开发链路。三方共同实现从场景生成、仿真交互、数据采集到模型训练的端到端平台化运行。同期,影眸与港大、上海交大共建ManiTwin-100K数据集,含十万级可交互3D资产,每件标注抓取位姿、功能区域与物理参数,直通SAPIEN、Isaac Sim等机器人仿真环境。
游戏领域反馈迅速:2026年8月末灰度测试启动当日,即有游戏公司员工主动对接API需求。WorldGen生成的独立资产无缝融入现有3D生产管线,支持Unity中国团结引擎2.0及Unreal Engine等平台,已应用于关卡快速迭代与UGC内容创作。影视方向,WorldGen提供可控白模,锁定空间状态与物体关系,解决视频生成中连续镜头间物体形变与位移不一致问题;已有创作者将WorldGen与Seedance 2.5串联为实际影视制作工作流,相关作品处于制作阶段。
空间计算方面,WorldGen支持USDZ导出,兼容iPhone与Apple Vision Pro;生成范围涵盖前景物体及远景环境(如天空),支持用户自由步入、多视角观察、物体替换与交互添加,适用于室内设计、沉浸式教育与XR内容创作。
影眸Hyper3D明确区分‘世界生成’与泛义‘世界模型’:WorldGen聚焦3D内容生产侧,显式建模物体、空间关系与物理属性,而非模拟动力学或决策规划;其命名选择‘WorldGen’而非‘SceneGen’,源于对开放场景的支持能力,但公司刻意保持与当前边界模糊的‘世界模型公司’标签距离。创始人吴迪指出,技术主线始终是拓展3D生成的‘可用性’——从单次高质量生成,到可控、可拆解、可组合、可接入工作流的生产系统,类比大模型由Chatbot向Agent演进。未来优化方向包括关节与柔性体物理精度提升、Sim-to-Real迁移落差缩小,以及更完整的物理世界还原能力。此次发布标志着3D生成正从孤立资产迈向可运行、可交互、多场景复用的三维环境,竞争焦点亦由单模型性能转向场景理解、状态保持、物理建模与工作流集成能力。
免责声明:本文内容由开放的智能模型自动生成,仅供参考。



