用数字看 AI 的采用。
每个维度都是一篇来自公开数据源的数据短文 — 有图表、图表背后的故事,以及得出数字的公开算法。选择一个维度开始探索。
选择一个维度…
能力
从文本到工作:AI 已经会做什么
要在 GPQA Diamond 上追平 GPT-4,每百万输出 token 的价格从 60 美元跌到 2.19 美元 — 同一场考试,便宜近 30 倍,用了不到两年。
三年多一点的时间里,模型从「补全句子」跃升到解决研究生难题、独立关闭代码 issue、支撑起数百亿美元的公司。这个维度用三个镜头度量这次跃升 — 它们知道什么、能执行什么、已经带动多少钱 — 最后落在那场为「不可战胜」而设计的考试上。
认知能力 — 按年份与价格
每个点是一个前沿模型:何时发布(横轴)、在 GPQA Diamond — 「谷歌搜不到答案」的研究生难题 — 上得了多少分(纵轴)、处于哪个价格档(颜色)。天花板在上升,同时更浅色的点显示同样的智能正在变得便宜:DeepSeek-R1 以每百万 token 2 美元交出了 71%。
- 2023-03GPT-435.7%US$60/M
- 2024-03Claude 3 Opus50.4%US$75/M
- 2024-05GPT-4o53.6%US$10/M
- 2024-06Claude 3.5 Sonnet59.4%US$15/M
- 2024-12o178%US$60/M
- 2025-02Claude 3.7 Sonnet78.2%US$15/M
- 2025-03Gemini 2.5 Pro84%US$10/M
- 2025-08GPT-588.4%US$10/M
- 2025-11Gemini 3 Pro91.9%US$12/M
- 2026-02Gemini 3.1 Pro94.1%US$12/M
这张图说明了什么
纵轴是 GPQA Diamond 的准确率(100% = 全对)。2023 年 GPT-4 以每百万 token 60 美元拿到 36%;不久后 DeepSeek-R1 以 2.19 美元做到了 71% — 翻倍。这就是大数字的由来:超越 GPT-4 变便宜了 96%。能力上升,价格崩落。
- 方法
- GPQA Diamond (198 questões de pós-graduação, 'à prova de Google'), score oficial pass@1 na data de lançamento. Preço = tabela de saída do provedor (US$/M tokens); cor = faixa de preço, linha = recorde acumulado.
- 来源
- Epoch AI — GPQA Diamond
- 数据快照
- 2026年7月05日
行动能力 — 解决问题,而不只是回答
答得好是一回事;端到端完成任务是另一回事。SWE-bench Verified 度量的正是这个:500 个真实的 GitHub issue,模型必须修改代码库直到测试通过。不到两年,前沿从三分之一到了几乎全部。
- 2024-08GPT-4o33%
- 2024-103.5 Sonnet49%
- 2025-023.7 Sonnet62.3%
- 2025-05Opus 472.5%
- 2025-08GPT-574.9%
- 2025-11Gemini 376.2%
- 2025-11Opus 4.580.9%
- 2026-04Opus 4.787.6%
- 2026-06Fable 5 👑95%
Claude Fable 5 目前在三个智能体测试套件中的表现
- SWE-bench Verifiedcódigo de ponta a ponta95
- Terminal-Bench 2.1tarefas no terminal88
- τ-benchatendimento com ferramentas89.2
- 方法
- SWE-bench Verified: 500 issues reais do GitHub resolvidas de ponta a ponta (editar o repo até os testes passarem) — o padrão de capacidade agêntica de código. Escada = recorde por data; barras = líder atual em três suítes. Nota: em 2026 um estudo de Berkeley mostrou que essas suítes podem ser 'gameadas' — leia como tendência.
- 来源
- SWE-bench (leaderboard oficial)
- 数据快照
- 2026年7月05日
背后的经济 — 谁在赚钱,赚多少
能力以前所未有的速度变成了收入。OpenAI 在这个十年开局领先,但 2026 年 Anthropic 曲线交叉反超 — 由企业级编程用途拉动。数字为年化 run-rate(月收入乘十二),来自公司披露与媒体报道。
最新一轮估值
标尺的尽头
Humanity's Last Exam — 为「不可战胜」而设计的考试
当模型开始在 MMLU 这类测试中拿满分,基准测试就失去了意义:再也分不出谁领先。2025 年 1 月,Center for AI Safety 与 Scale AI 给出了答案 — 汇集人类能写出的最难的一场考试。
它是怎么出的
- 1来自 500 多所机构的约一千名专家在各自领域提交了超过 7 万道题 — 从拓扑学到病毒学。
- 2一道题只有在当时最强的模型答错时才能入选:简单的当场淘汰,是一道针对前沿本身的对抗性过滤。
- 3幸存的题目经过两轮同行评审,最终留下 3000 道 — 2500 道公开、500 道保密,用来抓「背题」的模型。
- 4题目为封闭式作答(76% 精确简答、24% 多选;约 14% 需要图片),因此可以自动评分、公平比较。
最佳分数随时间变化(%)
- 2025-01o18%
- 2025-04o317%
- 2025-08GPT-525.3%
- 2025-11Gemini 3 Pro37.5%
- 2026-02Gemini 3.1 Pro45%
- 2026-06Fable 553.3%
最早的模型只能答对 3% 到 8%。十八个月后,前沿越过了一半 — 在一场被设计为短期内不可攻克的考试上。这正是这个维度想要捕捉的速度。
- 方法
- Center for AI Safety (CAIS) + Scale AI. 3,000 questões (2,500 públicas + 500 secretas) em 100+ disciplinas, filtradas contra a fronteira. Lançado em 24/01/2025.
- 来源
- Humanity's Last Exam (CAIS + Scale AI)
- 数据快照
- 2026年7月05日