产品简介
SANA-Video 2.0 是一款高效的混合视频扩散Transformer,专为在单GPU上生成720p高质量视频而设计。它通过创新的混合线性注意力与注意力残差技术,在保持线性注意力长序列优势的同时,达到了与全softmax视频DiT相媲美的生成质量。该模型提供5B和14B两种规模,采用统一架构,兼顾效率与性能。
核心功能
- 混合线性注意力:结合线性注意力与注意力残差,避免二次复杂度,支持高效长视频序列生成。
- 单GPU 720p生成:优化设计使得在单GPU上即可生成720p分辨率的高质量视频,降低硬件门槛。
- 统一架构多规模:提供5B和14B参数版本,共享统一架构,灵活适配不同计算资源与质量需求。
适合谁用
以下类型的用户会特别受益于 SANA-Video 2.0:
- 视频内容创作与快速原型设计
- 科研与教育中的视频生成实验
- 资源受限环境下的高质量视频生成
优点亮点
- 单GPU即可运行,部署成本低
- 生成质量媲美全softmax模型
- 长序列处理高效,适合高分辨率视频
价格与方案
开源模型,免费使用
总结与建议
SANA-Video 2.0 通过混合线性注意力与注意力残差技术,在单GPU上实现了720p视频的高效生成,兼顾质量与性能,适合资源受限的高质量视频生成场景。
版本演进
- MOSS-VL技术报告:将实时交互作为一等能力的开源视觉语言模型家族 (2026-08-15):MOSS-VL是一个将实时交互(边感知边说话)作为一等能力的开源视觉语言模型家族,通过门控交叉注意力让语言解码器在生成时同步处理视觉输入。MOSS-VL-Realtime在四个流式基准中平均成绩居开源模型之首(三项第一、一项第二),在OmniMMI Proactive Alerting上以66.0分大幅领先最佳基线(37.5分)。
- UEmbed:统一稀疏与稠密的多模态嵌入模型 (2026-08-03):UEmbed 是一种仅解码器的多模态嵌入模型,可在单次因果前向传播中同时生成稀疏词级和稠密表示,通过可学习特殊 token 与词汇表分区突破单 token 信息瓶颈。