新模型 2026-09-10

京东开源可交互视听世界模型 EchoWM:一句话生成视频,还能“走进去”探索

京东开源可交互视听世界模型 EchoWM:一句话生成视频,还能“走进去”探索

发生了什么

9 月 9 日的京东全球科技探索者大会(JDD)上,京东探索研究院发布并开源了可交互视听世界模型 JoyAI-EchoWM。

它和常见的“输入一句话、吐一段视频”的 AI 视频不一样:EchoWM 在同一个框架里联合生成 720P 视频、环境音、音乐和语音,声音会随场景、镜头和主体运动同步变化;更关键的是,它支持实时交互——你用键盘(WASD 之类)操作,画面就跟着走,可以在生成出来的世界里“第一人称漫游”或“第三人称跟拍”,还能多轮连续探索。它通过统一的“相机意图”表示,把键盘操作映射成连续的运动轨迹。在涵盖 158 个多轮导航案例的 WBench Navigation 评测里,EchoWM 取得了综合排名第一。

对我有什么用

过去的世界模型通常走两条路:一类能随你操作持续生成画面,但没声音;另一类能联合生成音视频,但你很难“走进去”持续改变内容。EchoWM 把两类能力合到一起,意味着 AI 生成内容正从“可以看”走向“可以进入和探索”——这是游戏、互动叙事、虚拟游览、数字人表演等场景的关键一步。

我可以怎么做

  • 做短视频/广告/互动内容的创作者:未来可以用它快速搭一个可探索的 3D 场景试玩,验证镜头和路线再决定要不要正式做。
  • 房产、景区、博物馆:可以低成本生成可自由漫游的数字化场景,不用逐帧建模。
  • 开发者:代码已开源(GitHub: jd-opensource/JoyAI-Echo),想研究世界模型的人可以直接拉下来改。

温馨提醒

  • 模型目前没有显式的持久三维记忆,长时间生成仍可能出现画面“漂移”,离真正稳定的开放世界还有距离。
  • 是科研/开源项目,落地到商用产品仍需自己接入和打磨;普通用户暂不能直接点开使用。
📤 一键转发小助手 帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发