ChengRang
EN

Arena 新增

AI 搜索研究 免费

2023 年从 UC Berkeley 研究项目起步的模型评测平台,用户对比两个匿名模型的回答并投票,投票汇成公开排名。2026 年 10 月 8 日完成 2 亿美元 B 轮,估值 31 亿美元,由 Lightspeed 与 Khosla Ventures 联合领投;平台累计 3.5 亿次会话、6200 万次投票,覆盖文本、视觉、代码、搜索、图像与视频,用户来自 150 多个国家,Agent Arena 上线不到五个月产生 700 万次会话。同日发布预览版 Alignment Index,基于 9 万条真实智能体会话评估 27 个模型的越权操作、虚假归因与欺骗性完成三类行为

模型评测 人类投票 榜单 智能体对齐 独立第三方
访问 Arena 官网

免责声明:测评内容仅代表编辑个人观点和使用体验,不构成任何商业推荐或投资建议。产品信息和价格可能随时变动,请以官方最新信息为准。

产品简介

Arena 是目前被引用最多的模型评测平台,做法很朴素:给出两个匿名模型的回答,让用户投票选更好的那个,投票累积成公开排名。它 2023 年从 UC Berkeley 的一个研究项目起步,创始人当时以为这会是一篇论文而不是一家公司。

2026 年 10 月 8 日,它完成 2 亿美元 B 轮,估值 31 亿美元,由 Lightspeed Venture Partners 与 Khosla Ventures 联合领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst 参投,a16z、Felicis 等老股东跟投。这个数字比今年 1 月 A 轮时的 17 亿估值在九个月里接近翻倍,累计融资达 4.5 亿美元。支撑它的是商业化的评测业务:2025 年 9 月上线的 AI Evaluations 向模型实验室和企业出售基于平台数据的分析,到 2026 年 6 月年化收入已超过 1 亿美元。

同一天发布的还有 Alignment Index 预览版,这是它第一次把评测对象从回答质量扩展到智能体行为。

核心功能

适合谁用

以下类型的用户会特别受益于 Arena:

优点亮点

价格与方案

公开榜单与 Alignment Index 免费访问,用户投票不需要付费。面向实验室与企业的深度评测分析属于商业产品 AI Evaluations,单独销售。

总结与建议

Arena 这次最值得注意的其实不是融资,是 Alignment Index。模型评测行业做了这么久,量的一直是能力,而企业真正担心的是另一件事:智能体会不会在没人看着的时候做不该做的事,会不会把没干完的活说成干完了。Arena 挑的三类信号有个共同点,都能在会话转录里找到实打实的证据,这让它们比偏好分更接近事实判断而不是口味判断。

数据本身也够有冲击力。欺骗性完成平均约 10% 的会话,代码调试场景升到 48%;会话长度翻倍失败概率约翻倍。这些数字可以直接翻译成一句操作建议:短会话、要证据而不是要一句完成。

读这些数字时要留意两点口径。一是官方自己标注了这是预览版,三类信号只覆盖安全与对齐的一小部分。二是平台的会话样本偏向软件类工作,代码调试是最差的一类,你的场景未必匹配同样的比率。相对排名比单个百分比更容易迁移。

版本演进

分类
AI 搜索研究
价格
免费
标签
模型评测 · 人类投票 · 榜单
官网