别只看世界模型榜单第一:HiDream-O1-World 还要过哪些工程门禁
从 WBench 分项、空间记忆、物理交互和在线适配出发,拆解公开证据与后续验收标准。
世界模型生成式 AI多模态AI 视频
判断一个世界模型有没有真正进步,不能只看它能不能生成一张漂亮的奇幻场景。更严格的问题是:用户走出去以后,回头还能不能找到原来的路;物体被挡住再出现时,位置是否一致;修改天气或增加物体后,原有世界是否继续存在。HiDream-O1-World 的公开 Demo 和 WBench 成绩,正好把这些问题摆到了台面上。
这篇文章不把官方案例当成独立实测。当前 HiDream-O1-World 尚未提供完整的公众体验,相关描述主要依据官方展示和公开榜单;重点放在评测证据、技术边界和后续验收标准。

先把世界模型拆成五个门禁
WBench 将交互式世界模型拆为质量、场景设定、交互、一致性和物理。画面质量回答是否自然,场景设定回答是否遵守条件,交互回答动作是否响应,一致性回答同一个世界能否持续,物理回答物体和动作是否合理。只看画质,无法判断模型是否真的可探索。
公开证据与边界
HiDream-O1-World 公开介绍的两条主线是 3D 先验注入 Memory 和 TTT。前者维护几何、位置和遮挡关系,后者根据新视角和轨迹在线适配。公开榜单显示它综合分 80.9、一致性 88.0、物理 73.3,排名第一。这是特定基准下的领先结果,不是所有开放环境下的全面证明。
工程验收表
| 维度 | 记录内容 | 失败信号 |
|---|---|---|
| 一致性 | 回退、转身、遮挡后的差异 | 建筑漂移、道路重构 |
| 物理 | 碰撞、遮挡、重力、持久性 | 穿模、物体消失 |
| 编辑 | 目标修改范围 | 局部指令导致全局重生成 |
| 性能 | 延迟、显存、长时成本 | 短 Demo 可用、持续运行不可用 |
| 证据 | 版本、输入、日志、失败样例 | 只有宣传视频 |
结论
HiDream-O1-World 代表世界模型从生成眼前画面走向维护可探索空间的尝试。WBench 结果值得关注,但空间记忆、在线适配和物理交互仍需要更多公开实验。当前不宜追着榜单部署,应该等待模型、接口和失败数据完整后,用自己的长时交互任务验收。