Skip to content

Next.js Agent Evals

How well AI coding agents perform real Next.js tasks.

View on GitHub
Last run date: September 11, 2026

Current evals

Latest agents, rerun whenever the evals change.

Agent
Claude Fable 5.1 (high)
Claude Code
247.59s
$0.722
97%
97%
Claude Opus 5
Claude Code
368.39s
$1.96
94%
97%
Gemini 3.8 Flash
OpenCode
434.82s
$0.605
90%
97%
GPT 6 Astra (high)
Codex
251.89s
$0.891
90%
97%
Kimi K3
OpenCode
352.34s
$0.281
84%
97%
GLM 5.2
OpenCode
395.50s
$0.152
81%
97%
Claude Sonnet 5
Claude Code
263.04s
$0.386
81%
97%
Cursor Composer 2.5
Cursor
273.56s
$0.062
81%
94%
MiniMax M3
OpenCode
260.09s
$0.053
81%
90%
Kimi K2.7 Code
OpenCode
318.42s
$0.139
74%
90%

Previously measured

Superseded agents. Last results, dated — not rerun.

Agent
GPT 5.6 Sol (ultra) Sep 8, 2026
Codex
342.05s
$0.356
77%
77%
Claude Fable 5 (high) Sep 8, 2026
Claude Code
268.46s
$1.78
77%
77%
Grok 4.6 Aug 13, 2026
OpenCode
234.68s
$0.160
71%
71%
GPT 5.3 Codex (xhigh) Aug 27, 2026
Codex
286.50s
$0.278
68%
74%
Claude Opus 4.8 May 28, 2026
Claude Code
165.91s
$0.348
68%
74%
Grok 4.5 Jul 8, 2026
OpenCode
142.52s
$0.073
65%
74%
GPT 5.4 (xhigh) Jul 17, 2026
Codex
227.98s
$0.238
65%
68%
GPT 5.5 Pro Apr 26, 2026
Codex
771.63s
$18.21
65%
65%
GLM 5.1 Apr 16, 2026
OpenCode
253.24s
$0.077
58%
74%
Claude Opus 4.7 (max) Apr 16, 2026
Claude Code
142.48s
$0.445
58%
74%
Claude Opus 4.6 Apr 6, 2026
Claude Code
189.27s
$0.204
58%
74%
Gemini 3.1 Pro Preview Apr 6, 2026
Gemini CLI
247.45s
$0.110
58%
71%
Cursor Composer 2.0 Apr 6, 2026
Cursor
115.52s
$0.031
58%
71%
Kimi K2.6 Jun 17, 2026
OpenCode
197.69s
$0.057
52%
74%
Gemini 3.0 Pro Preview Apr 6, 2026
Gemini CLI
260.37s
$0.165
52%
65%
Claude Sonnet 4.6 Apr 6, 2026
Claude Code
157.50s
$0.140
45%
74%
GPT 5.2 Codex (xhigh) Apr 6, 2026
Codex
149.60s
$0.150
45%
61%
Claude Sonnet 4.5 Apr 6, 2026
Claude Code
150.53s
$0.130
39%
65%
MiniMax M2.7 Apr 6, 2026
OpenCode
293.14s
$0.026
39%
48%
Kimi K2.5 Apr 6, 2026
OpenCode
134.99s
$0.018
16%
45%

* AGENTS.md provides bundled Next.js documentation for AI coding agents. The column shows additional evals that passed when agents had access to this documentation.

N/A marks evals a model has never run (newly added evals). They count against the success rate so all models are scored over the same eval set. Reworked evals keep a model's last result until it is rerun.

Success Rate is pass@4: an eval passes if any of four attempts passes. Infrastructure failures are discarded and rerun, never counted.

Avg List Cost: mean cost per eval, from provider-reported token counts (including cache) at the public list prices in effect when the results were exported — some models are on time-limited introductory rates. Rare runs without counts use a length-based estimate. A relative guide, not a bill.