产品简介
Vidu S2 是生数科技于 2026 年 9 月 15 日发布的实时视频模型,距离 Vidu S1 发布仅 69 天,包含两个模型:面向持续交互数字角色生成的 Vidu S2-Avatar,以及面向输入视频流实时编辑的 Vidu S2-Editing。发布当天即全量开放网页体验与 API,不需要申请早期体验名额。
S2-Avatar 相比上一代的提升集中在三处:实时输出从 540P 提升到 720P,帧率 25 至 42 FPS;支持在视频流生成过程中随时递入新的参考图,让角色拿起指定物品、换上指定服装或进入新场景;动作能力从以说话为主扩展到独舞、2D 与 3D 动画等全身大幅度动作。这类交互还涉及动作完成后的状态保持,例如「拿起杯子然后微笑」要求角色在微笑时继续持杯,模型通过 VLM Agent 读取用户指令并按时序检查输出帧,判断动作是已完成、部分完成还是偏离要求,再调整后续提示词。
S2-Editing 接收持续输入的视频流,用一条文本指令加一张可选参考图完成四类实时编辑:风格迁移、虚拟试穿、人物替换与背景替换。人物抬手、转身或镜头移动时,编辑结果需要跟随这些变化,底层依靠帧对齐稀疏注意力,让目标帧只读取源视频同一时刻的画面,避免不同时刻的动作信息互相干扰。
两个模型之上,生数科技还把探索延伸到了空间视频:把实时生成或实时编辑的画面转换为左右眼有视差的同步视图,流式传输到 VR 头显,用于空间视频中的角色互动与画面编辑。目前以固定视角的双目视频为主,全景空间视频仍在探索阶段。整条实时链路的技术路线由生数科技流式视频生成与推理负责人张金涛(朱军教授博士生)负责。
核心功能
- 720P 实时输出与 25-42 FPS:S2-Avatar 相比 Vidu S1 的 540P 提升到 720P,实时帧率 25 至 42 FPS,采用 Backbone 与 Refiner 两阶段架构:主干在低分辨率下负责动作与长程时序,单步 Refiner 恢复高分辨率细节。
- 生成过程中随时更新参考图:视频流播放到任意时刻都可以递入新的参考图,让角色拿起身旁的杯子、换上指定服装或进入新场景,交互不被中断,模型会持续保留已完成动作的状态信息。
- 全身大幅度动作跟随:训练数据加入独舞与 2D、3D 动画素材,配合人类偏好优化,支持舞蹈等大幅度身体动作的指令跟随,不再局限于说话头式表现。
- 四类实时视频编辑:S2-Editing 支持实时风格迁移、虚拟试穿、人物替换与背景替换,在人物持续运动、镜头移动的情况下保持编辑结果与原视频的时序对齐。
- 帧对齐稀疏注意力:目标帧只与源视频同一时刻的画面交互,参考图对所有目标帧保持可见,前者提供动作与空间结构,后者引导外观变化,减少实时编辑中的穿帮与撕裂。
- SRF 自回放训练:Self-Replay Forcing 让模型先从自生成轨迹中采样片段重新加噪做因果回放训练,学习相邻片段之间的误差关系,缓解长时间流式生成中的身份漂移与动作断裂。
- 面向 VR 头显的空间视频:把实时生成或实时编辑的单目画面转换为左右眼同步视图,流式传输至 VR 头显;S2-Editing 既支持先编辑普通视频再转空间视频,也支持直接编辑已有双目视频。
- S2-Avatar 离线批量生成:另有面向预设内容生产的离线接口,可根据图片、文案或音频批量生成动作时间点可控的数字人口播视频,走异步生成流程。
适合谁用
以下类型的用户会特别受益于 Vidu S2:
- 直播与虚拟带货:角色在实时互动中随时拿起新产品展示,并保持持物状态继续讲解
- 实时虚拟试穿:消费者在购买前看到服饰贴合自身动作的试穿效果,降低决策成本
- 实时风格化拍摄:摄像头视频流边拍边改画风、服装、主体或背景,无需后期重做
- 短剧与广告素材裂变:一条原片实时派生多种视觉风格,适配不同圈层的投放
- 虚拟拍摄与混合现实:把摄像头透视画面接入编辑流程,实时改环境
- VR 空间视频体验:把实时互动与实时编辑结果送到头显里观看
优点亮点
- 发布即全量开放体验,同时给出网页入口、API 平台与技术报告
- S2-Avatar 在 StreamAV-Bench 报告的九项指标中均为第一,主体一致性 0.998、背景一致性 0.993
- S2-Editing 在 OpenVE 与 RefVIE 联合评测取得 4.26 总体得分,Sparkle-Bench 总体得分 3.74
- 720P 实时输出配合 25-42 FPS,覆盖舞蹈等大幅度动作
- 生成过程中可随时更新参考图,交互自由度相比上一代明显扩大
- 四类编辑任务共用一条文本指令加一张参考图的交互方式,上手门槛低
- 把实时链路延伸到 VR 头显的空间视频,给出论文与完整技术流程
价格与方案
网页体验入口为 vidu.com/vidu-stream,API 通过 platform.vidu.com 的 Vidu S2 文档接入。计费按模型与调用方式区分,实时数字人可选择包含语音识别、语言模型、语音合成与实时通信的整套服务,也可使用组件模式接入已有语音系统;离线生成走异步接口。具体单价与新用户额度以官网与 API 平台公告为准。
总结与建议
Vidu S2 把视频生成从生成一段内容推进到实时操控一条持续运行的视频流,两条线各有明确场景:S2-Avatar 面向实时数字人交互,S2-Editing 面向实时视频编辑。相比 Vidu S1,这一代的变化不只是分辨率从 540P 到 720P,控制对象从固定数字人扩展到动态参考图与完整视频流,动作能力扩展到全身表演,还多了一步面向 VR 头显的空间视频探索。做直播、虚拟试穿、实时虚拟拍摄或短剧素材批量派生的团队,值得从 Day 1 直接上手测试;如果需求只是离线生成一段成片,Vidu Q3 这类成熟的成片模型仍是更省事的选择。
版本演进
- Vidu S2 发布:S2-Avatar 与 S2-Editing 双模型,并探索空间视频 (2026-09-15):生数科技发布 Vidu S2,距 Vidu S1 仅 69 天。S2-Avatar 把实时输出从 540P 提升至 720P、帧率 25-42 FPS,支持生成过程中随时更新参考图并增强舞蹈等大幅度动作跟随;S2-Editing 面向输入视频流做实时风格迁移、虚拟试穿、人物替换与背景替换。两个模型之上探索了面向 VR 头显的空间视频生成与编辑。评测方面,S2-Avatar 在 StreamAV-Bench 九项指标中均为第一(主体一致性 0.998、背景一致性 0.993),S2-Editing 在 OpenVE 与 RefVIE 联合评测得 4.26、Sparkle-Bench 得 3.74。发布当天全量开放网页体验与 API 接入。