Affärslivet AI Intelligence
AI models, compared
Source-cited specifications and benchmarks for 35 notable frontier AI models. Parameters, training compute, cost and independent evaluation scores — from GPT-5 and Grok 4 to the latest open-weight releases. Every figure traces to Epoch AI.
35 models · 18 with benchmarks · Source: Epoch AI (CC BY 4.0) · Updated 2026-08-17
Benchmark leaderboard
Notable models ranked by GPQA Diamond (graduate-level science reasoning), with scores across Epoch AI's reproducible evaluations. Independent runs — not developer-reported figures. Higher is better.
| Model | Developer | GPQA Diamond | SWE-Bench Verified | FrontierMath | MATH Level 5 | SimpleQA | AIME (OTIS Mock) |
|---|---|---|---|---|---|---|---|
| Kimi K3 | Moonshot | 93.1% | — | — | — | 42.7% | 97.2% |
| Grok 4 | xAI | 87.0% | — | 19.7% | — | 47.9% | 84.0% |
| GPT-5 | OpenAI | 86.2% | 73.6% | 32.4% | 98.1% | 50.6% | 91.4% |
| Claude 3.7 Sonnet | Anthropic | 79.7% | 61.0% | 4.1% | 91.2% | — | 57.8% |
| Grok 3 | xAI | 75.8% | — | 3.8% | 88.7% | — | 55.6% |
| Qwen3-Max | Alibaba | 72.6% | — | — | 97.1% | 67.5% | 73.3% |
| GPT-4.5 | OpenAI | 68.7% | — | — | 78.6% | — | 37.8% |
| Gemini 1.5 Pro | Google DeepMind | 57.2% | — | — | 70.4% | — | 23.1% |
| Claude 3.5 Sonnet | Anthropic | 54.0% | — | 1.0% | 51.7% | — | 6.5% |
| Grok-2 | xAI | 53.8% | — | 0.7% | 63.5% | — | 11.5% |
| Llama 3.1-405B | Meta AI | 50.9% | — | — | 49.8% | — | 9.7% |
| GPT-4o | OpenAI | 49.2% | 31.0% | 0.3% | 53.3% | — | 6.4% |
| Claude 3 Opus | Anthropic | 47.2% | — | — | 37.5% | — | 4.7% |
| GPT-4 Turbo (Apr 2024) | OpenAI | 46.6% | — | — | 46.7% | — | 6.7% |
| GPT-4 Turbo (Nov 2023) | OpenAI | 42.4% | — | — | 40.0% | — | — |
| GPT-4 (Mar 2023) | OpenAI | 35.7% | — | — | — | — | 0.6% |
| Claude 2 | Anthropic | 34.7% | — | — | 11.7% | — | 2.5% |
| GPT-4 (Jun 2023) | OpenAI | 30.7% | — | — | 23.0% | — | 1.1% |
Blank = not evaluated on that benchmark. Source: Epoch AI Benchmarking Hub.
All models — specifications
Every notable frontier model since 2023, newest first, with parameters, training compute and weight availability. Click a model for its full spec sheet and benchmarks.
| Model | Developer | Released | Parameters | Training compute | Weights |
|---|---|---|---|---|---|
| Kimi K3 | Moonshot | 2026-07-16 | 2.8T | 2e25 FLOP | Open |
| Composer 2.5 | Cursor | 2026-05-18 | 1.0T | 3.9e25 FLOP | Closed |
| Composer 2 | Cursor | 2026-03-19 | 1.0T | 2.3e25 FLOP | Closed |
| Qwen3-Max | Alibaba | 2025-09-05 | 1.0T | 1.5e25 FLOP | Closed |
| GPT-5 | OpenAI | 2025-08-07 | — | 6.6e25 FLOP | Closed |
| Grok 4 | xAI | 2025-07-09 | 3.0T | 5e26 FLOP | Closed |
| Pangu Ultra | Huawei | 2025-04-10 | 135B | 1.1e25 FLOP | Closed |
| Llama 4 Behemoth (preview) | Meta AI | 2025-04-05 | 2.0T | 5.2e25 FLOP | Closed |
| GPT-4o (Mar 2025) | OpenAI | 2025-03-27 | — | — | Closed |
| GPT-4.5 | OpenAI | 2025-02-27 | — | 3.8e26 FLOP | Closed |
| Claude 3.7 Sonnet | Anthropic | 2025-02-24 | — | 3.4e25 FLOP | Closed |
| Grok 3 | xAI | 2025-02-17 | 3.0T | 3.5e26 FLOP | Closed |
| GPT-4o (Jan 2025) | OpenAI | 2025-01-29 | — | — | Closed |
| GPT-4o (Nov 2024) | OpenAI | 2024-11-20 | — | — | Closed |
| Doubao-pro | ByteDance | 2024-10-28 | 500B | 2.5e25 FLOP | Closed |
| GLM-4-Plus | Z.ai (Zhipu AI) | 2024-08-29 | — | — | Closed |
| Grok-2 | xAI | 2024-08-13 | — | 3e25 FLOP | Closed |
| GPT-4o (Aug 2024) | OpenAI | 2024-08-06 | — | — | Closed |
| Llama 3.1-405B | Meta AI | 2024-07-23 | 405B | 3.8e25 FLOP | Open |
| Claude 3.5 Sonnet | Anthropic | 2024-06-20 | — | 2.7e25 FLOP | Closed |
| Nemotron-4 340B | NVIDIA | 2024-06-14 | 340B | 1.8e25 FLOP | Open |
| GPT-4o | OpenAI | 2024-05-13 | — | — | Closed |
| GPT-4 Turbo (Apr 2024) | OpenAI | 2024-04-09 | — | — | Closed |
| Aramco Metabrain AI | Saudi Aramco | 2024-03-04 | 250B | 1e25 FLOP | Closed |
| Claude 3 Opus | Anthropic | 2024-03-04 | — | — | Closed |
| Gemini 1.5 Pro | Google DeepMind | 2024-02-15 | — | — | Closed |
| Gemini 1.0 Ultra | Google DeepMind | 2023-12-06 | — | 5e25 FLOP | Closed |
| Inflection-2 | Inflection AI | 2023-11-22 | — | 1e25 FLOP | Closed |
| GPT-4 Turbo (Nov 2023) | OpenAI | 2023-11-06 | — | — | Closed |
| Amazon Titan | Amazon | 2023-09-28 | 200B | 4.8e24 FLOP | Closed |
| Falcon-180B | Technology Innovation Institute | 2023-09-06 | 180B | 3.8e24 FLOP | Open |
| Claude 2 | Anthropic | 2023-07-11 | — | 3.9e24 FLOP | Closed |
| GPT-4 (Jun 2023) | OpenAI | 2023-06-13 | 1.8T | 2.1e25 FLOP | Closed |
| PaLM 2 | 2023-05-10 | 340B | 7.3e24 FLOP | Closed | |
| GPT-4 (Mar 2023) | OpenAI | 2023-03-15 | 1.8T | 2.1e25 FLOP | Closed |
“—” = undisclosed by the developer. Training compute in FLOP (e.g. 6.6e25 = 6.6×10²⁵). Source: Epoch AI, Notable AI Models.