ChengRang
EN

CUA-Lite 新增

AI 开发平台 开源

Berkeley RDI 开源的计算机使用智能体开放平台:Lite.Gym、Lite.Sample 与模型 harness 统一环境、数据与训练链路,15+ 基准即插即用,免虚拟机桌面沙箱内置 3 万+ 可验证任务,支持 14 个模型族评测与训练

开源 智能体 评测 CUA 基准 Berkeley
访问 CUA-Lite 官网

免责声明:测评内容仅代表编辑个人观点和使用体验,不构成任何商业推荐或投资建议。产品信息和价格可能随时变动,请以官方最新信息为准。

产品简介

Berkeley RDI 于 2026 年 9 月开源了 CUA-Lite,一个面向计算机使用智能体(computer-use agent)的开放开发与评测平台。所谓计算机使用智能体,就是能像人一样操作桌面软件、浏览器和手机 App 的 AI,OpenAI、Anthropic、Qwen 等厂商的 CUA 类模型是这一赛道的代表。过去这类开发链路高度碎片化:每个环境有各自的接口和运行时,每份监督数据集的格式不同,每个模型的动作空间与提示格式也不一样,把模型接进环境往往要反复重写同一套代码。CUA-Lite 用三个标准化抽象把这三件事统一起来。

Lite.Gym 是统一的环境接口,把 OSWorld、WebArena、AndroidWorld、WebGym 等 15 个以上基准收敛成一套 reset、step、close 循环,统一了截图观察与 click、type、tap、swipe 动作空间;Lite.Sample 是统一的监督数据格式,已把 Mind2Web、GUIOdyssey 等 10 多个数据集预处理后免费发布在 Hugging Face;每个模型族配一个 harness,同一套代码贯穿评测、SFT 与 RL 三个环节,目前支持 GPT、Claude、Qwen、Gemini 等 14 个模型族。

CUA-Lite 最实在的贡献是免虚拟机的桌面沙箱:用 Docker 容器复刻 OSWorld 桌面环境,不需要 /dev/kvm 这类硬件虚拟化,任何装了 Docker 的主机都能跑,内置 3 万多个可验证训练任务,Lite.OSWorld 还能原样运行 OSWorld 官方任务与评测器。官方已发布横跨 13 个 agent、325 个任务的排行榜(gpt-5.5 以 72.3% 居首,Qwen3.5-27B 以 46.2% 居开源第一),评测结果可一键复现。

核心功能

适合谁用

以下类型的用户会特别受益于 CUA-Lite:

优点亮点

价格与方案

完全开源免费,数据集在 Hugging Face 公开下载,评测环境与模型适配代码均为开源组件。

总结与建议

CUA-Lite 是 Berkeley RDI 开源的计算机使用智能体开发平台,用 Lite.Gym、Lite.Sample 与模型 harness 三套抽象统一了环境、数据与训练链路,让任意模型接入任意基准不必重写代码。免虚拟机桌面沙箱与 3 万多个可验证任务是其区别于同类开源项目的关键,适合研究机构与开发者进行 CUA 智能体的评测、微调与强化学习。

分类
AI 开发平台
价格
开源
标签
开源 · 智能体 · 评测