ChengRang
EN

Prime Inference 新增

AI 开发平台 付费

Prime Intellect 推出的推理服务平台,serverless 端点与预留容量双形态、跨数据中心自动故障转移、OpenAI 兼容 API,首发部署 GLM-5.3

推理平台 serverless OpenAI 兼容 GLM-5.3 开源模型
访问 Prime Inference 官网

免责声明:测评内容仅代表编辑个人观点和使用体验,不构成任何商业推荐或投资建议。产品信息和价格可能随时变动,请以官方最新信息为准。

产品简介

Prime Inference 是 Prime Intellect 于 2026 年 10 月 2 日发布的推理服务平台,用来把前沿开源模型跑在生产环境里。它提供 serverless 端点和预留容量两种形态:前者应对波动的需求,后者承接稳定持续的负载。模型跑在 Prime 自己的 GPU 集群上,横跨多个数据中心,某个集群出问题会自动把流量切到健康的部署上。

在公开发布之前,这套平台已经在 Prime 内部跑了很久,大规模强化学习 rollout、合成数据生成、评测、长时运行的编码智能体,光内部每天就要处理接近一万亿 token。从今年 1 月起,它也在为客户的规模化生产部署提供服务。Prime 的说法是,这种压力让团队把优化目标定在持续的性能、质量和可靠性上,而不是跑分高低。

第一个公开部署是 GLM-5.3,9 月 22 日在 OpenRouter 上线,是 OpenRouter 上最快的 GLM-5.3 端点之一,上线以来保持 100% 可用,工具调用错误率接近零。

核心功能

适合谁用

以下类型的用户会特别受益于 Prime Inference:

优点亮点

价格与方案

Prime 在发布公告里没有公布具体的每百万 token 价格,只说明了计费方式:serverless 端点与预留容量分别计价,统一账单,支持团队级用量追踪。路线图上还有面向大批量离线任务的 batch 与异步推理,价格会更低。

总结与建议

Prime Inference 不是又一个模型 API 聚合商,它是 Prime Intellect 给自己那套持续学习闭环补上的最后一环:训练出来的模型能真正服务用户、产生新的经验数据、再把生产轨迹送回训练。这个出身决定了它的优化方向,不是单次 benchmark 的峰值,而是长时间跑下来不掉链子。

如果你要跑的是长时运行的编码智能体,工具调用的可靠性往往比首 token 延迟更致命,Prime 在这块下了实功夫,给 Dynamo 贡献了 GLM 格式的 structural-tag builder,还建了自己的工具调用测试套件。定价没公布这件事值得留意,选型前得先算过。

版本演进

分类
AI 开发平台
价格
付费
标签
推理平台 · serverless · OpenAI 兼容