智象未来:交互式世界模型的“时空一致性”突围——原生全模态架构下的平台生态竞速

企业 智象未来(HiDream AI)
行业 信息传输、软件和信息技术服务业
年份 2026
难度 高级
适用课程 数字经济与平台经济
核心概念 平台生态位,技术标准竞争,价值网络重构,原生全模态架构
来源 改编

案例摘要

一、案例背景 2026年8月17日,智象未来正式发布交互式世界模型HiDreamO1World。这款被业内视为“AI从感知走向认知”标志性产品的模型,具备漫游、编辑、交互三大核心功能,支持文本、图像、交互操控等多模态输入方式。用户只需一段文字描述、一张图片或简单交互,即可一键生成时空一致、符合物理规律、可长时推演的完整世界。 智象未来成立于2023年,总部位于北京,是一家专注于多模态生成式AI…

案例正文

一、案例背景

2026年8月17日,智象未来正式发布交互式世界模型HiDream-O1-World。这款被业内视为“AI从感知走向认知”标志性产品的模型,具备漫游、编辑、交互三大核心功能,支持文本、图像、交互操控等多模态输入方式。用户只需一段文字描述、一张图片或简单交互,即可一键生成时空一致、符合物理规律、可长时推演的完整世界。

智象未来成立于2023年,总部位于北京,是一家专注于多模态生成式AI技术研发的前沿科技企业。公司核心团队来自微软亚洲研究院、字节跳动、百度等头部科技机构,创始人兼CEO曾在计算机视觉领域发表百余篇顶级会议论文。自成立以来,智象未来始终押注“原生全模态”技术路线——即从底层架构层面实现文本、图像、视频、3D、交互等多种模态的统一表征与生成,而非通过多个独立模型拼接实现多模态能力。

此次发布的HiDream-O1-World搭载了智象自研的原生全模态(UiT)架构。该架构在交互式世界模型领域公认的两大核心技术挑战——时空一致性与物理一致性——上取得关键突破:当镜头推拉摇移时,场景空间的几何结构保持高度稳定,物体不会消失或变形;物体间的碰撞、遮挡、重力响应高度符合真实世界的因果逻辑,而非随机“猜”出来的画面拼接。

在第三方评测中,HiDream-O1-World首次参评即在美团LongCat团队与复旦大学联合推出的交互式视频世界模型评测基准WBench中登顶Navi分榜,以平均分80.9的成绩位列榜首。其中物理(Physical)维度以73.3分位列第一,一致性(Consistency)维度达88.0分。WBench是业内首个面向交互式世界模型的系统性评测基准,涵盖289个多轮交互案例、共计1058个交互轮次,基于五大维度、22项指标构建量化评测体系。

智象未来CTO姚霆在发布会上表示:“交互式世界模型的价值,不在于生成一个逼真的三维场景,而在于AI开始真正理解空间的深度、物体的质感、运动的惯性与光影的逻辑。这是对物理世界运行规律的系统性认知与重塑。”

……

发表讨论

您的邮箱地址不会被公开。