产品简介
Artificial Analysis 是一个第三方模型评测站,最常被引用的产出是 Intelligence Index,一个把多项评测加权合成的综合分。2026 年 9 月 4 日发布 v4.2,定位是 v5 之前的过渡版本,把原计划放在 v5 里的部分改动提前放了出来。
它同时给出分数、每任务成本与输出 token 效率三条曲线,很多团队拿它做选型的起点。
核心功能
- 九项评测加权成综合分:Index 覆盖 Agents 34%、Coding 24%、Scientific Reasoning 24%、General 18% 四类权重。
- 私有测试集权重翻倍到 40%:v4.1 是 20%,v4.2 提到 40%。私有集包含 AA-Briefcase、AA-Omniscience 与 CritPt 的解答。公开基准容易被写进训练数据,提高私有集占比是直接抬高「刷榜」成本的做法。
- 新增 AA-Briefcase:自研的智能体知识工作评测,题目由行业专家设计,模拟跨数周、任务相互关联、源文件上千的真实项目。模型在无网络的沙箱 Linux 环境里跑,上限 500 轮,带代码执行工具。评分同时用二元评分表与成对 Elo 比较,评判组由 Opus 4.8、GPT-5.5、Gemini 3.1 Pro Preview 轮换担任,降低同门偏好。
- 新增 GDP.pdf:由 Surge AI 制作,考单轮专业文档推理。100 份 PDF、十个领域、合计 4592 页,内容含正文、表格、图表、脚注与除外条款,答案按 1275 条专家原子判据评分。只有当一条任务的全部判据都满足,才计入 headline 的 All-pass Rate。
- 退役 GPQA Diamond:这项研究生级理科选择题已被前沿推理模型做到饱和,不再具备区分度,本版整体移除。
- 评分基建加固:AA-LCR 升到 v1.1,加入评分系统提示并修正答案键里的错误与歧义;GDPval-AA v2 与 AA-Briefcase 改进了抽样并重新锚定 Elo 标尺;SciCode 放宽沙箱执行限制,慢但正确的代码不再被计为失败。
- 成本维度同屏对比:除分数外还给出每任务成本与输出 token 效率两条前沿曲线,方便按预算而不是只看排名来选型。
适合谁用
以下类型的用户会特别受益于 Artificial Analysis:
- 选型前横向比较各家前沿模型的分数、成本与 token 效率
- 跟踪某一家实验室的模型迭代节奏与相对位置
- 评估智能体类任务的真实完成度,而不是只看单项问答分数
- 需要引用第三方评测数据时,作为公开可溯源的出处
优点亮点
- 私有测试集占比高,分数更难被针对已知题目调优
- 同时给出成本与 token 效率,选型时能按预算取舍
- 方法论与逐模型明细公开,可追溯
- 退役饱和基准的态度明确,榜单的区分度维护得比较好
价格与方案
网站内容开放浏览,免费。方法论与逐模型明细在 artificialanalysis.ai/methodology/intelligence-benchmarking 公布。
总结与建议
榜单的价值取决于它有多难被喂。Artificial Analysis 这一版的改动几乎全部指向同一件事——压缩厂商针对已知题目调优的空间。把私有集权重翻倍、退役已经饱和的 GPQA Diamond、给评分沙箱补漏,都是为了让分数更接近模型在陌生任务上的真实水平。v4.2 的结果里 Claude Fable 5.1 综合第一,GPT-6 Astra 第二并在 GDP.pdf 上以 33.2% 领先。需要注意分数会随评测版本变动,跨版本直接比大小容易失真。
版本演进
- Intelligence Index v4.2 (2026-09-04):私有测试集权重由 20% 提升至 40%;新增 AA-Briefcase 与 GDP.pdf;退役 GPQA Diamond
- Intelligence Index v4 (2026-01):重构综合分体系,四类权重结构定型