Affärslivet

Affärslivet AI Intelligence

AI models, compared

Source-cited specifications and benchmarks for 35 notable frontier AI models. Parameters, training compute, cost and independent evaluation scores — from GPT-5 and Grok 4 to the latest open-weight releases. Every figure traces to Epoch AI.

35 models · 18 with benchmarks · Source: Epoch AI (CC BY 4.0) · Updated 2026-08-17


Benchmark leaderboard

Notable models ranked by GPQA Diamond (graduate-level science reasoning), with scores across Epoch AI's reproducible evaluations. Independent runs — not developer-reported figures. Higher is better.

ModelDeveloperGPQA DiamondSWE-Bench VerifiedFrontierMathMATH Level 5SimpleQAAIME (OTIS Mock)
Kimi K3 Moonshot 93.1%42.7%97.2%
Grok 4 xAI 87.0%19.7%47.9%84.0%
GPT-5 OpenAI 86.2%73.6%32.4%98.1%50.6%91.4%
Claude 3.7 Sonnet Anthropic 79.7%61.0%4.1%91.2%57.8%
Grok 3 xAI 75.8%3.8%88.7%55.6%
Qwen3-Max Alibaba 72.6%97.1%67.5%73.3%
GPT-4.5 OpenAI 68.7%78.6%37.8%
Gemini 1.5 Pro Google DeepMind 57.2%70.4%23.1%
Claude 3.5 Sonnet Anthropic 54.0%1.0%51.7%6.5%
Grok-2 xAI 53.8%0.7%63.5%11.5%
Llama 3.1-405B Meta AI 50.9%49.8%9.7%
GPT-4o OpenAI 49.2%31.0%0.3%53.3%6.4%
Claude 3 Opus Anthropic 47.2%37.5%4.7%
GPT-4 Turbo (Apr 2024) OpenAI 46.6%46.7%6.7%
GPT-4 Turbo (Nov 2023) OpenAI 42.4%40.0%
GPT-4 (Mar 2023) OpenAI 35.7%0.6%
Claude 2 Anthropic 34.7%11.7%2.5%
GPT-4 (Jun 2023) OpenAI 30.7%23.0%1.1%

Blank = not evaluated on that benchmark. Source: Epoch AI Benchmarking Hub.

All models — specifications

Every notable frontier model since 2023, newest first, with parameters, training compute and weight availability. Click a model for its full spec sheet and benchmarks.

ModelDeveloperReleasedParametersTraining computeWeights
Kimi K3 Moonshot 2026-07-16 2.8T 2e25 FLOP Open
Composer 2.5 Cursor 2026-05-18 1.0T 3.9e25 FLOP Closed
Composer 2 Cursor 2026-03-19 1.0T 2.3e25 FLOP Closed
Qwen3-Max Alibaba 2025-09-05 1.0T 1.5e25 FLOP Closed
GPT-5 OpenAI 2025-08-07 6.6e25 FLOP Closed
Grok 4 xAI 2025-07-09 3.0T 5e26 FLOP Closed
Pangu Ultra Huawei 2025-04-10 135B 1.1e25 FLOP Closed
Llama 4 Behemoth (preview) Meta AI 2025-04-05 2.0T 5.2e25 FLOP Closed
GPT-4o (Mar 2025) OpenAI 2025-03-27 Closed
GPT-4.5 OpenAI 2025-02-27 3.8e26 FLOP Closed
Claude 3.7 Sonnet Anthropic 2025-02-24 3.4e25 FLOP Closed
Grok 3 xAI 2025-02-17 3.0T 3.5e26 FLOP Closed
GPT-4o (Jan 2025) OpenAI 2025-01-29 Closed
GPT-4o (Nov 2024) OpenAI 2024-11-20 Closed
Doubao-pro ByteDance 2024-10-28 500B 2.5e25 FLOP Closed
GLM-4-Plus Z.ai (Zhipu AI) 2024-08-29 Closed
Grok-2 xAI 2024-08-13 3e25 FLOP Closed
GPT-4o (Aug 2024) OpenAI 2024-08-06 Closed
Llama 3.1-405B Meta AI 2024-07-23 405B 3.8e25 FLOP Open
Claude 3.5 Sonnet Anthropic 2024-06-20 2.7e25 FLOP Closed
Nemotron-4 340B NVIDIA 2024-06-14 340B 1.8e25 FLOP Open
GPT-4o OpenAI 2024-05-13 Closed
GPT-4 Turbo (Apr 2024) OpenAI 2024-04-09 Closed
Aramco Metabrain AI Saudi Aramco 2024-03-04 250B 1e25 FLOP Closed
Claude 3 Opus Anthropic 2024-03-04 Closed
Gemini 1.5 Pro Google DeepMind 2024-02-15 Closed
Gemini 1.0 Ultra Google DeepMind 2023-12-06 5e25 FLOP Closed
Inflection-2 Inflection AI 2023-11-22 1e25 FLOP Closed
GPT-4 Turbo (Nov 2023) OpenAI 2023-11-06 Closed
Amazon Titan Amazon 2023-09-28 200B 4.8e24 FLOP Closed
Falcon-180B Technology Innovation Institute 2023-09-06 180B 3.8e24 FLOP Open
Claude 2 Anthropic 2023-07-11 3.9e24 FLOP Closed
GPT-4 (Jun 2023) OpenAI 2023-06-13 1.8T 2.1e25 FLOP Closed
PaLM 2 Google 2023-05-10 340B 7.3e24 FLOP Closed
GPT-4 (Mar 2023) OpenAI 2023-03-15 1.8T 2.1e25 FLOP Closed

“—” = undisclosed by the developer. Training compute in FLOP (e.g. 6.6e25 = 6.6×10²⁵). Source: Epoch AI, Notable AI Models.

Go deeper

Which countries build the most AI models →

Country ranking