al-Qantara
观察站

用数字看 AI 的采用。

每个维度都是一篇来自公开数据源的数据短文 — 有图表、图表背后的故事,以及得出数字的公开算法。选择一个维度开始探索。

选择一个维度…

能力

从文本到工作:AI 已经会做什么

0%更便宜

要在 GPQA Diamond 上追平 GPT-4,每百万输出 token 的价格从 60 美元跌到 2.19 美元 — 同一场考试,便宜近 30 倍,用了不到两年。

三年多一点的时间里,模型从「补全句子」跃升到解决研究生难题、独立关闭代码 issue、支撑起数百亿美元的公司。这个维度用三个镜头度量这次跃升 — 它们知道什么、能执行什么、已经带动多少钱 — 最后落在那场为「不可战胜」而设计的考试上。

认知能力 — 按年份与价格

每个点是一个前沿模型:何时发布(横轴)、在 GPQA Diamond — 「谷歌搜不到答案」的研究生难题 — 上得了多少分(纵轴)、处于哪个价格档(颜色)。天花板在上升,同时更浅色的点显示同样的智能正在变得便宜:DeepSeek-R1 以每百万 token 2 美元交出了 71%。

  • 2023-03GPT-435.7%US$60/M
  • 2024-03Claude 3 Opus50.4%US$75/M
  • 2024-05GPT-4o53.6%US$10/M
  • 2024-06Claude 3.5 Sonnet59.4%US$15/M
  • 2024-12o178%US$60/M
  • 2025-02Claude 3.7 Sonnet78.2%US$15/M
  • 2025-03Gemini 2.5 Pro84%US$10/M
  • 2025-08GPT-588.4%US$10/M
  • 2025-11Gemini 3 Pro91.9%US$12/M
  • 2026-02Gemini 3.1 Pro94.1%US$12/M

这张图说明了什么

纵轴是 GPQA Diamond 的准确率(100% = 全对)。2023 年 GPT-4 以每百万 token 60 美元拿到 36%;不久后 DeepSeek-R1 以 2.19 美元做到了 71% — 翻倍。这就是大数字的由来:超越 GPT-4 变便宜了 96%。能力上升,价格崩落。

方法
GPQA Diamond (198 questões de pós-graduação, 'à prova de Google'), score oficial pass@1 na data de lançamento. Preço = tabela de saída do provedor (US$/M tokens); cor = faixa de preço, linha = recorde acumulado.
来源
Epoch AI — GPQA Diamond
数据快照
2026年7月05日

行动能力 — 解决问题,而不只是回答

答得好是一回事;端到端完成任务是另一回事。SWE-bench Verified 度量的正是这个:500 个真实的 GitHub issue,模型必须修改代码库直到测试通过。不到两年,前沿从三分之一到了几乎全部。

  1. 2024-08GPT-4o
    33%
  2. 2024-103.5 Sonnet
    49%
  3. 2025-023.7 Sonnet
    62.3%
  4. 2025-05Opus 4
    72.5%
  5. 2025-08GPT-5
    74.9%
  6. 2025-11Gemini 3
    76.2%
  7. 2025-11Opus 4.5
    80.9%
  8. 2026-04Opus 4.7
    87.6%
  9. 2026-06Fable 5 👑
    95%

Claude Fable 5 目前在三个智能体测试套件中的表现

  • SWE-bench Verifiedcódigo de ponta a ponta
    95
  • Terminal-Bench 2.1tarefas no terminal
    88
  • τ-benchatendimento com ferramentas
    89.2
方法
SWE-bench Verified: 500 issues reais do GitHub resolvidas de ponta a ponta (editar o repo até os testes passarem) — o padrão de capacidade agêntica de código. Escada = recorde por data; barras = líder atual em três suítes. Nota: em 2026 um estudo de Berkeley mostrou que essas suítes podem ser 'gameadas' — leia como tendência.
来源
SWE-bench (leaderboard oficial)
数据快照
2026年7月05日

背后的经济 — 谁在赚钱,赚多少

能力以前所未有的速度变成了收入。OpenAI 在这个十年开局领先,但 2026 年 Anthropic 曲线交叉反超 — 由企业级编程用途拉动。数字为年化 run-rate(月收入乘十二),来自公司披露与媒体报道。

US$0 biUS$7,5 biUS$15 biUS$22,5 biUS$30 bi202420252026
OpenAIAnthropic

最新一轮估值

US$852 biOpenAI · 2026
US$965 biAnthropic · mai/2026

标尺的尽头

Humanity's Last Exam — 为「不可战胜」而设计的考试

当模型开始在 MMLU 这类测试中拿满分,基准测试就失去了意义:再也分不出谁领先。2025 年 1 月,Center for AI Safety 与 Scale AI 给出了答案 — 汇集人类能写出的最难的一场考试。

它是怎么出的

  1. 1来自 500 多所机构的约一千名专家在各自领域提交了超过 7 万道题 — 从拓扑学到病毒学。
  2. 2一道题只有在当时最强的模型答错时才能入选:简单的当场淘汰,是一道针对前沿本身的对抗性过滤。
  3. 3幸存的题目经过两轮同行评审,最终留下 3000 道 — 2500 道公开、500 道保密,用来抓「背题」的模型。
  4. 4题目为封闭式作答(76% 精确简答、24% 多选;约 14% 需要图片),因此可以自动评分、公平比较。

最佳分数随时间变化(%)

  • 2025-01o1
    8%
  • 2025-04o3
    17%
  • 2025-08GPT-5
    25.3%
  • 2025-11Gemini 3 Pro
    37.5%
  • 2026-02Gemini 3.1 Pro
    45%
  • 2026-06Fable 5
    53.3%

最早的模型只能答对 3% 到 8%。十八个月后,前沿越过了一半 — 在一场被设计为短期内不可攻克的考试上。这正是这个维度想要捕捉的速度。

方法
Center for AI Safety (CAIS) + Scale AI. 3,000 questões (2,500 públicas + 500 secretas) em 100+ disciplinas, filtradas contra a fronteira. Lançado em 24/01/2025.
来源
Humanity's Last Exam (CAIS + Scale AI)
数据快照
2026年7月05日

探索各个维度