一、案例背景
2026年8月17日,智象未来正式发布交互式世界模型HiDream-O1-World。这款被业内视为“AI从感知走向认知”标志性产品的模型,具备漫游、编辑、交互三大核心功能,支持文本、图像、交互操控等多模态输入方式。用户只需一段文字描述、一张图片或简单交互,即可一键生成时空一致、符合物理规律、可长时推演的完整世界。
智象未来成立于2023年,总部位于北京,是一家专注于多模态生成式AI技术研发的前沿科技企业。公司核心团队来自微软亚洲研究院、字节跳动、百度等头部科技机构,创始人兼CEO曾在计算机视觉领域发表百余篇顶级会议论文。自成立以来,智象未来始终押注“原生全模态”技术路线——即从底层架构层面实现文本、图像、视频、3D、交互等多种模态的统一表征与生成,而非通过多个独立模型拼接实现多模态能力。
此次发布的HiDream-O1-World搭载了智象自研的原生全模态(UiT)架构。该架构在交互式世界模型领域公认的两大核心技术挑战——时空一致性与物理一致性——上取得关键突破:当镜头推拉摇移时,场景空间的几何结构保持高度稳定,物体不会消失或变形;物体间的碰撞、遮挡、重力响应高度符合真实世界的因果逻辑,而非随机“猜”出来的画面拼接。
在第三方评测中,HiDream-O1-World首次参评即在美团LongCat团队与复旦大学联合推出的交互式视频世界模型评测基准WBench中登顶Navi分榜,以平均分80.9的成绩位列榜首。其中物理(Physical)维度以73.3分位列第一,一致性(Consistency)维度达88.0分。WBench是业内首个面向交互式世界模型的系统性评测基准,涵盖289个多轮交互案例、共计1058个交互轮次,基于五大维度、22项指标构建量化评测体系。
智象未来CTO姚霆在发布会上表示:“交互式世界模型的价值,不在于生成一个逼真的三维场景,而在于AI开始真正理解空间的深度、物体的质感、运动的惯性与光影的逻辑。这是对物理世界运行规律的系统性认知与重塑。”
……