编程 JoyAI-Echo:京东开源长视频生成框架,角色一致性达分钟级

2026-09-05 19:02:26

JoyAI-Echo:京东开源长视频生成框架,角色一致性达分钟级

Sora关闭之后,AI视频赛道反而更热了。国产的可灵、即梦、海艺都在发力,但长视频角色一致性仍是行业公认的难题,目前能彻底解决的工具不多。

最近京东开源了 JoyAI-Echo,由京东 JoyFutureAcademy 团队开发。它能让5分钟视频中的人物脸部、声音和服饰保持不变,不会出现越拍越不像自己的情况。项目在GitHub上已获得1600 Star,两周内增长迅速。

六项核心技术

1. 跨模态记忆库:角色第一次出现时,把脸型、声音和穿着等特征记录到记忆库中。生成后续镜头时,把之前的信息作为条件提取出来,强迫AI用同一个角色绘制。记忆库把视觉与听觉结合,不仅保存人脸照片,还保存声音,因此脸和声音都能保持一致。官方测评显示语音内容正确率为0.8646,用户喜好测试中音频质量达81.7%。

2. DMD分布匹配蒸馏:传统多步扩散模型生成长视频耗时很长,角色一致性要求越高计算量越大。JoyAI-Echo使用DMD技术把多步扩散压缩为少步推理,实现约7.5倍速度提升,且不降低角色一致性。

3. 音视频联合生成:很多工具视频和音频分开生成,口型和台词很难对上。JoyAI-Echo用一个管道同时输出视频和声音,对白、环境音和背景音乐一起产生,口型与台词同步生成,无需后期修改。音频采样率16000Hz、梅尔频谱bins为128、窗函数长度为96。

4. 对话式编辑(Director Agent):传统工具改一个镜头就要重新生成整个视频。JoyAI-Echo的"导演助理"功能可以只修改指定镜头,比如"把第三个镜头里的主人公换上红色衣服"。该功能目前尚未发布。

5. 显存优化方案:默认配置需要46-50G显存,官方建议H100或A100。也提供降级方案,将默认241帧改为121帧可大幅减少显存占用。项目还提供ComfyUI集成方案,使用官方节点包ComfyUI_JoyAI_Echo,支持48G显存下热切换,每个镜头可添加注释并实时预览。

快速上手

克隆仓库并配置环境:

git clone https://github.com/jd-opensource/JoyAI-Echo.git
conda env create -f environment.yml
conda activate echo-long

下载权重是最大门槛,需要从 HuggingFace 下载约46GB模型文件,还有 gemma-3-12b 文本编码器约24GB。

在 prompts 目录下创建JSON格式的提示文件,使用 python inference.py 生成视频。项目还提供 Prompt Enhancer,可将简短故事想法转化为包含角色、动作、风格、镜头、背景、音效的有组织镜头描写。

当前局限

  • 暂不支持I2V(图像到视频),只能文字生成,不能用图片作为起始帧
  • 采用 LTX-2 Community License,仅限学术研究和非商业用途,商业使用需联系Lightricks
  • 仅开放推理代码和权重,未开放训练代码
  • Director Agent 和 Echo-SR 超分模块标注为待发布

项目支持本地部署,视频素材不上传云端,隐私性更高。对硬件要求不低,官方推荐约46-50GB显存,但对有相关配置、又经常制作AI视频的用户来说值得尝试。

开源地址:https://github.com/jd-opensource/JoyAI-Echo

推荐文章

程序员茄子在线接单