产品简介
Prime Inference 是 Prime Intellect 于 2026 年 10 月 2 日发布的推理服务平台,用来把前沿开源模型跑在生产环境里。它提供 serverless 端点和预留容量两种形态:前者应对波动的需求,后者承接稳定持续的负载。模型跑在 Prime 自己的 GPU 集群上,横跨多个数据中心,某个集群出问题会自动把流量切到健康的部署上。
在公开发布之前,这套平台已经在 Prime 内部跑了很久,大规模强化学习 rollout、合成数据生成、评测、长时运行的编码智能体,光内部每天就要处理接近一万亿 token。从今年 1 月起,它也在为客户的规模化生产部署提供服务。Prime 的说法是,这种压力让团队把优化目标定在持续的性能、质量和可靠性上,而不是跑分高低。
第一个公开部署是 GLM-5.3,9 月 22 日在 OpenRouter 上线,是 OpenRouter 上最快的 GLM-5.3 端点之一,上线以来保持 100% 可用,工具调用错误率接近零。
核心功能
- 两种容量形态:serverless 端点应对可变需求,预留容量承接持续负载;统一账单与团队级用量追踪,让推理开销更好管理
- 跨数据中心韧性:公共 API 与模型集群分离,容量可以迁移、失效或扩容而不改变客户端端点;共享断路器让每个网关副本对故障反应一致,基于租约的准入控制防止过载并在进程消失后自动恢复容量
- OpenAI 兼容接入:把任意 OpenAI SDK 指向
https://api.pinference.ai/api/v1即可接入,也可以用prime inference chat 'z-ai/glm-5.3'这样的命令直接对话 - 面向智能体流量调优的推理栈:组合 NVIDIA Dynamo、vLLM、Mooncake 与 FlashInfer,与 Inferact 和 NVIDIA 深度协作开发,改进会贡献回上游
- 可靠的工具调用:为 Dynamo 贡献了 GLM 格式的 structural-tag builder,把工具定义翻译成约束生成结果的规则,vLLM 用 xgrammar 在解码阶段屏蔽违规 token;官方维护自己的工具调用测试套件
- 下探到硬件的健康检查:每个集群持续监控,健康检查一路到 NVLink 与 InfiniBand,告警直达 7×24 值班团队,GPU 故障被快速修复而不是让服务慢慢劣化
适合谁用
以下类型的用户会特别受益于 Prime Inference:
- 需要在生产环境长期跑编码智能体、并且对工具调用正确性有硬要求的团队
- 做大规模强化学习 rollout 或合成数据生成、需要稳定高吞吐推理的研究团队
- 想在多个数据中心之间做故障转移、不想被单一可用区绑住的工程团队
- 已经在用 OpenAI SDK 的工具链、希望无缝切到开源前沿模型的开发者
优点亮点
- 发布前已在内部每天处理近一万亿 token,是从真实生产负载里长出来的平台
- serverless 与预留容量二选一,波动负载和稳定负载各得其所
- 跨数据中心自动故障转移,健康检查下探到 NVLink 与 InfiniBand
- OpenAI 兼容,现有 SDK 和工具直接接入
- 工具调用有专门的 grammar 约束与测试套件,长会话里错误率接近零
- 建立在 vLLM、Dynamo、Mooncake、FlashInfer 等开源组件上,改进回灌上游
价格与方案
Prime 在发布公告里没有公布具体的每百万 token 价格,只说明了计费方式:serverless 端点与预留容量分别计价,统一账单,支持团队级用量追踪。路线图上还有面向大批量离线任务的 batch 与异步推理,价格会更低。
总结与建议
Prime Inference 不是又一个模型 API 聚合商,它是 Prime Intellect 给自己那套持续学习闭环补上的最后一环:训练出来的模型能真正服务用户、产生新的经验数据、再把生产轨迹送回训练。这个出身决定了它的优化方向,不是单次 benchmark 的峰值,而是长时间跑下来不掉链子。
如果你要跑的是长时运行的编码智能体,工具调用的可靠性往往比首 token 延迟更致命,Prime 在这块下了实功夫,给 Dynamo 贡献了 GLM 格式的 structural-tag builder,还建了自己的工具调用测试套件。定价没公布这件事值得留意,选型前得先算过。
版本演进
- Prime Inference 发布 (2026-10-02):Prime Intellect 发布推理服务平台 Prime Inference,覆盖 serverless 端点与预留容量,跨数据中心提供前沿开源模型的韧性推理服务;模型跑在 NVIDIA Blackwell 上,Vera Rubin 在路上。首个公开部署 GLM-5.3 于 9 月 22 日在 OpenRouter 上线,是 OpenRouter 上最快的 GLM-5.3 端点之一,上线以来 100% 可用、工具调用错误率接近零。路线图包含 batch 与异步推理,以及自有微调模型的一键部署