EchoWM – 京东开源的交互式视听世界模型
EchoWM是什么
EchoWM 是京东探索研究院开源的交互式视听世界模型。模型延续JoyAI-Echo的原生音视频生成能力,让用户以第一/第三人称视角在AI生成的世界中实时移动探索,画面、空间关系与环境音、语音持续同步且长时间不跑偏。模型采用统一相机意图接口与世界数据引擎训练,WBench导航评测平均分81.7位列第一。

EchoWM的主要功能
- 实时可探索世界生成:用户可通过WASD方向键在AI生成的场景中自由移动、转身、折返,世界随操作实时展开。
- 原生音视频联合生成:在同一框架内同步生成720p视频与环境音、音乐、人物语音,声音随画面变化自然延续。
- 第一/第三人称双视角控制:第一人称下镜头即观察者移动,第三人称下镜头自动跟随人物、车辆等主体运动。
- 多轮长时程延续:用上一段末尾的音视频作为下一轮上下文,多轮操作后场景布局、主体外观与声音依然连贯。
- WBench导航评测第一:158个案例中平均得分81.7,一致性与交互性指标均居前列。
EchoWM的技术原理
统一相机意图接口:将离散的键盘指令映射为相对初始位姿的连续6-DoF轨迹,用同一套接口描述镜头如何移动;第一人称下它直接表示观察者运动,第三人称下由模型从数据中学习”主体移动—镜头跟随”的耦合关系,无需额外的角色轨迹或相机预设参数,且轨迹仅注入视频分支,音频随画面联动。
世界数据引擎:整合四类互补数据源,内部采集gameplay、人类实玩录像、UE仿真、普通互联网视频;再用轨迹最大平移幅度的第90百分位数为全局”尺子”统一归一化,保留不同轨迹间的相对位移差异,避免分段定标带来的速度突变。
渐进式四阶段训练:第一阶段用AV-rich数据做音视频持续预训练打底;第二阶段冻结骨干、只训练轻量轨迹分支强化控制响应;第三阶段用兼具控制可靠性与视听质量的数据低学习率联合微调;第四阶段自回归后训练,通过Teacher Forcing改造为因果分块生成,结合短时程Self-Gradient Forcing让模型适应自己生成的历史,再用分布匹配蒸馏压缩为四步采样,配合sink-plus-FIFO缓存机制在控制KV成本的同时支撑长时程流式交互。
微信关注回复“开源”,加入AI开源项目交流群
如何使用EchoWM
- 克隆仓库:git clone 下载 github.com/jd-opensource/JoyAI-Echo,进入 echo_wm/ 目录(与长视频项目 echo_longvideo/ 相互独立)。
- 创建环境:conda create -n echo-wm python=3.11 创建独立环境并激活。
- 安装依赖:先装 PyTorch 2.9.1(cu128),再 pip install -r requirements.txt,并用 torch.cuda.is_available() 验证显卡可用。
- 下载模型权重:用 hf download Echo-Team/Echo-WM 下载模型 checkpoint;另需下载 Gemma 3 文本编码器(gated 仓库,需先在 HF 页面接受许可并 hf auth login)。
- 跑官方示例验证:运行 scripts/run_wm_case.py --case examples/wm_cases/0010 等内置完整案例,确认环境配置无误。
- 自定义生成:运行 inference_wm.py,传入首帧图片 + 六字段提示词+ 动作串(Action DSL)即可输出带声音的视频。
- 编写动作指令:用 Action DSL 描述相机运动,格式为 <按键>-<帧数>,逗号连接,如 w-60,a-60 表示前进60帧后左移60帧,支持 w/s/a/d/i/j/k 组合。
EchoWM的核心优势
- 视听一体化:在同一框架内原生联合生成720p视频与环境音、音乐、语音,声音随画面场景和事件同步变化,解决了多数世界模型”只出画面不出声”的问题。
- 统一控制接口:用一套相对6-DoF轨迹同时驱动第一人称观察者移动和第三人称镜头跟随主体,无需为不同视角单独设计控制器。
- 长时程连贯:通过自回归后训练与sink-plus-FIFO缓存机制,用户可基于上一轮末尾音视频上下文继续多轮探索,场景、主体与声音长时间不跑偏。
- 评测领先:WBench Navigation评测平均分81.7位列第一,用户研究整体偏好显著优于LingBot-World-v2和HappyOyster。
JoyAI-EchoWM的项目地址
项目官网:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm/
GitHub仓库:https://github.com/jd-opensource/JoyAI-Echo
arXiv技术论文:https://arxiv.org/pdf/2608.23189
EchoWM的同类竞品对比
| 对比维度 | EchoWM(京东) | HappyOyster |
|---|---|---|
| 产品定位 | 可进入的全模态世界模型 | 音视频联合生成 + 实时交互模型 |
| 交互模式 | 第一人称 + 第三人称双视角 | 导演模式 + 第一人称漫游模式 |
| 控制方式 | 统一相机意图接口(6-DoF 轨迹,WASD 映射) | 视角与动作控制(具体接口公开信息有限) |
| 音视频生成 | 原生联合生成 720p 视频 + 环境音/音乐/语音 | 支持音视频联合生成 |
| 长时程能力 | 多轮延续 + 自回归后训练,长时程一致性突出 | 支持交互式生成,长时程细节公开较少 |
| WBench 平均分 | 81.7(第1) | 76.8 |
| 用户研究(整体偏好) | 63.13% | 27.06% |
EchoWM的应用场景
- 游戏原型开发:创作者进入生成场景试玩,验证空间布局、路线设计与镜头体验后再决定制作方向。
- 互动叙事:剧情按用户选择分支推进并持续生成,替代传统预制素材,用于互动剧、互动小说。
- 沉浸式内容:影视与广告内容从”观看”变为”进入”,观众可自由探索画面中的世界。
- 虚拟游览:博物馆、景区、房产等场景的低成本数字化漫游,无需逐帧建模。
- 数字人表演:人物语音、动作与周围动态环境、镜头、声音协同生成,适用于虚拟主播、数字员工。
-
ffmpeg-skill – 开源的本地化视频剪辑与处理 Agent Skill
ffmpeg-skill是什么ffmpeg-skill 是面向编程 Agent(Claude Code/Cursor/Codex)的开源 Agent Skill,让 AI 能像专业剪辑师一样调用本地
-
teamai-cli – 腾讯开源的 AI 团队协作 CLI 工具
teamai-cli是什么TeamAI CLI 是腾讯开源的 MIT 协议 CLI 工具,用于统一管理团队的 AI 编程配置。工具将 skills、rules、MCP、hooks 等资源存入 Git
-
NeoHorse-1 – 基元律动联合无问芯穹等开源的 Agent 模型
NeoHorse-1是什么NeoHorse-1 是基元律动联合无问芯穹、清华、北大、港中文、阿里巴巴等推出的开源 Agent 模型,含 4B 与 9B 两版。模型采用 Agent-Native 后训练
关注公众号:拾黑(shiheibook)了解更多
友情链接:
关注数据与安全,洞悉企业级服务市场:https://www.ijiandao.com/
安全、绿色软件下载就上极速下载站:https://www.yaorank.com/







关注网络尖刀微信公众号
