产品简介
ML Drift 是 Google AI Edge 团队在 2026 年 10 月 8 日以 Apache 2.0 许可放出来的端侧 GPU 计算引擎,专门为设备上的 AI 推理打造。它的正式定位是 LiteRT 内部的 GPU 加速层,接替此前的 TFLite GPU delegate,同时也可以作为一个独立库,给自研的图形或推理运行时当底座。
要理解它为什么存在,得先看端侧 GPU 推理的麻烦在哪。数据中心里模型跑在同构、可预测的加速卡集群上,端侧却是一片硬件多样性:GPU 架构、驱动版本、底层 API 各不相同,开发者事先并不知道应用最终会落在哪块芯片上。TFLite GPU delegate 打下了 GPU 加速的地基,但它硬编码 4D 张量、着色器按后端各写一套,面对今天从实时视觉、音频、深度处理一直到大参数生成式模型的 workloads,算力和显存都成了瓶颈。ML Drift 想给的是一套通用工程底座,让经典模型和下一代模型在同一套框架里既有可移植性又有峰值性能。
核心功能
- 张量虚拟化与统一着色器:引入 tensor virtualization,把张量的逻辑表示与它在 GPU 上的物理分配解耦,由动态着色器模板在编译器初始化阶段解析并翻译坐标。过去 OpenGL、OpenCL、Metal 三套后端各维护一份着色器代码库的局面被消除,运行时开销极小,跨平台模型可移植性保留
- 四种底层 API 一套抽象:统一抽象 OpenGL ES、OpenCL、Metal 与 WebGPU,开发者不必为每种 GPU 架构和驱动版本分别适配,也无需预知应用最终跑在什么硬件上
- 5D 张量开箱可用:旧 delegate 结构上硬编码 4D,遇到 5D 张量只能靠布局 hack 绕。ML Drift 在新的 LiteRT GPU 加速器里原生支持 5D,3D 卷积网络这类体积与空间 AI,以及 YOLO 11n、MobileViT v2、Swin Transformer v2 这类时空模型可以直接跑在端侧 GPU 上
- 端侧大模型的阶段感知优化:自回归 LLM 的推理分成计算受限的 KV cache prefill 和显存带宽受限的逐 token decode 两个阶段,ML Drift 按当前执行阶段动态切换内核与布局配置;decode 阶段改用卷积对齐的 KV cache 布局,并施加剧烈的步内激活量化,绕开冗余的显存往返
- 可扩展自定义算子框架:提供直接注册 API 与底层着色语言访问能力,并附带一份面向编码智能体的 SKILL.md 指南,让智能体在几分钟内完成高性能自定义着色器的编写、注册与验证,把私有模型结构接进执行图的门槛大幅降低
- 桌面端预览与更低显存占用:WebGPU 后端原本为浏览器内加速设计,借助 Chromium 的 Dawn 实现,同一套代码可以在浏览器外原生编译,于是 Windows 与 Linux 上绕开 DirectX 和 Vulkan 的碎片化,macOS 上另有原生 Metal 后端。Gemma 基准中显存开销比其他框架低最多 12%
适合谁用
以下类型的用户会特别受益于 ML Drift:
- [object Object]
- [object Object]
- [object Object]
- [object Object]
- [object Object]
优点亮点
- Apache 2.0 开源,商用、修改与自托管都允许,没有配额与厂商锁定
- 一套代码覆盖 OpenGL ES、OpenCL、Metal 与 WebGPU,跨后端维护成本大幅下降
- 5D 张量原生支持,把体积与时空类模型从布局 hack 里解放出来
- 对端侧 LLM 的 prefill 与 decode 分别优化,decode 阶段的专用 KV cache 布局与步内量化直接打在显存带宽瓶颈上
- 已在 Chrome、YouTube Shorts、Google Photos、Google Meet 等日活数百万设备的产品上跑通生产验证,不是纸面框架
- 附带面向编码智能体的 SKILL.md 指南,自定义算子的编写验证可以直接交给智能体完成
- 显存开销比其他框架低最多 12%,给同机并行的其他本地任务腾出空间
价格与方案
以 Apache 2.0 许可开源,可免费商用、修改与自托管。官方文档与 LiteRT 一并维护,作为 LiteRT 的 GPU 加速层时也随 LiteRT 的开源许可提供,不单独收费。
总结与建议
ML Drift 的价值不在提出什么新算法,而在把端侧 GPU 推理这件事的工程底座重新做了一遍。张量虚拟化解决的是跨后端着色器的维护成本,5D 张量解决的是模型形态被框架结构卡住的问题,阶段感知优化解决的是端侧大模型真正的显存带宽瓶颈。它已经在 Google 自家一批日活千万级的产品上跑着,YouTube Shorts 降 40% 帧延迟、Google Photos 快 2 秒这类数字是生产环境里量出来的,不是基准表里的。
对开发者的实际意义是:如果你在做端侧视觉、端侧生成式模型或者本地编码智能体,现在有一套统一的、开源可改的 GPU 底座可用,不必再为每个后端分别调一套着色器。作为独立库使用时,它也可以嵌进自研的图形或推理运行时。需要注意的是桌面端目前仍是预览状态,官方的主要精力还是放在资源最紧的移动端与边缘设备上。
版本演进
- ML Drift 以 Apache 2.0 许可开源发布 (2026-10-08):Google AI Edge 团队发布跨平台端侧 GPU 计算引擎,作为 LiteRT 的核心 GPU 加速层接替 TFLite GPU delegate,也可作为独立库使用。统一抽象 OpenGL ES、OpenCL、Metal 与 WebGPU,引入张量虚拟化实现统一着色器,新增 5D 张量支持与可扩展自定义算子框架,并针对端侧大模型的 prefill 与 decode 阶段分别优化。已在 Chrome、YouTube Shorts、Google Photos、Google Meet 与 AI Edge Gallery 中投入生产,Adobe Lightroom 与 Photoshop 亦有采用;桌面端通过 Dawn 编译同一套代码提供预览支持