产品简介
JoyAI-Video-Edit 是京东开源的一款实时流式视频编辑系统,于2026年8月正式发布。该系统基于自回归扩散架构,能够在720P分辨率下以每秒30帧的速度处理视频,支持对直播流或上传视频进行因果逐帧编辑,无需等待完整视频即可实时输出结果。其核心能力在于通过自然语言指令实现多种编辑操作,如主体替换、局部修改、背景更换、风格迁移等。官方同时发布了部署代码、技术报告(arXiv:2608.03974)、在线演示与模型权重,并采用Apache 2.0协议,为视频编辑领域提供了新的开源解决方案。
核心功能
- 实时流式处理:采用因果视频VAE,仅依赖当前与过去帧进行编码,支持对直播流或上传视频进行逐帧实时编辑,端到端处理速度在720x1280分辨率下达30.19 FPS(单张NVIDIA B200实测)。
- 自然语言指令编辑:用户可通过自然语言描述编辑需求,系统自动执行主体替换(换装、换发型、角色变换)、局部编辑(移除指定物体)、背景更换、风格迁移(水彩、油画、赛博朋克)及运动修改等操作。
- 参考图引导编辑:支持上传参考图像,引导编辑过程,使生成结果更符合用户指定的视觉风格或内容特征。
- 高效自回归扩散架构:采用MLLM条件编码器与16B参数多模态扩散Transformer(MMDiT),结合ARMD蒸馏将去噪步骤压缩至两步,并引入长时程自回归蒸馏与有界KV状态推理,提升推理效率。
- 完整开源资源:提供部署代码、技术报告、在线demo(joyai-labs.jd.com/v2v/)及Hugging Face上的模型权重(jdopensource),并采用Apache 2.0协议,便于开发者使用与二次开发。
适合谁用
以下类型的用户会特别受益于 JoyAI-Video-Edit:
- 直播场景实时换装或更换背景,提升互动趣味性
- 视频后期制作中快速移除画面中的指定物体,无需逐帧手动处理
- 将普通视频转换为水彩、油画或赛博朋克等艺术风格
- 对人物进行发型或角色变换,用于创意内容生成
- 根据参考图引导编辑视频内容,实现风格统一的批量处理
优点亮点
- 实时处理能力突出,适合直播等低延迟场景
- 自然语言指令操作简便,降低视频编辑门槛
- 支持多种编辑类型,功能覆盖广泛
- 开源协议友好,代码与权重完整公开
- 技术方案创新,融合自回归扩散与因果VAE
- 在线demo方便快速体验,社区关注度较高(GitHub约1600 Star)
价格与方案
官方未公布具体定价信息,模型权重与代码均免费开源,使用成本以官网及GitHub仓库说明为准。
总结与建议
JoyAI-Video-Edit是京东开源的实时流式视频编辑系统,以自回归扩散架构实现720P下30 FPS的因果逐帧处理,支持自然语言驱动的多种编辑操作。其开源资源完整,技术方案高效,适合直播与创意视频处理场景。当前主要限制在于16B模型对显存要求较高,消费级显卡支持仍在推进中,完整训练管线尚未放出。