Next.js Agent Evals
How well AI coding agents perform real Next.js tasks.
Current evals
Latest agents, rerun whenever the evals change.
Agent | |||||
|---|---|---|---|---|---|
Claude Fable 5.1 (high) | Claude Code | 247.59s | $0.722 | 97% | 97% |
Claude Opus 5 | Claude Code | 368.39s | $1.96 | 94% | 97% |
Gemini 3.8 Flash | OpenCode | 434.82s | $0.605 | 90% | 97% |
GPT 6 Astra (high) | Codex | 251.89s | $0.891 | 90% | 97% |
Kimi K3 | OpenCode | 352.34s | $0.281 | 84% | 97% |
GLM 5.2 | OpenCode | 395.50s | $0.152 | 81% | 97% |
Claude Sonnet 5 | Claude Code | 263.04s | $0.386 | 81% | 97% |
Cursor Composer 2.5 | Cursor | 273.56s | $0.062 | 81% | 94% |
MiniMax M3 | OpenCode | 260.09s | $0.053 | 81% | 90% |
Kimi K2.7 Code | OpenCode | 318.42s | $0.139 | 74% | 90% |
Previously measured
Superseded agents. Last results, dated — not rerun.
Agent | |||||
|---|---|---|---|---|---|
GPT 5.6 Sol (ultra) Sep 8, 2026 | Codex | 342.05s | $0.356 | 77% | 77% |
Claude Fable 5 (high) Sep 8, 2026 | Claude Code | 268.46s | $1.78 | 77% | 77% |
Grok 4.6 Aug 13, 2026 | OpenCode | 234.68s | $0.160 | 71% | 71% |
GPT 5.3 Codex (xhigh) Aug 27, 2026 | Codex | 286.50s | $0.278 | 68% | 74% |
Claude Opus 4.8 May 28, 2026 | Claude Code | 165.91s | $0.348 | 68% | 74% |
Grok 4.5 Jul 8, 2026 | OpenCode | 142.52s | $0.073 | 65% | 74% |
GPT 5.4 (xhigh) Jul 17, 2026 | Codex | 227.98s | $0.238 | 65% | 68% |
GPT 5.5 Pro Apr 26, 2026 | Codex | 771.63s | $18.21 | 65% | 65% |
GLM 5.1 Apr 16, 2026 | OpenCode | 253.24s | $0.077 | 58% | 74% |
Claude Opus 4.7 (max) Apr 16, 2026 | Claude Code | 142.48s | $0.445 | 58% | 74% |
Claude Opus 4.6 Apr 6, 2026 | Claude Code | 189.27s | $0.204 | 58% | 74% |
Gemini 3.1 Pro Preview Apr 6, 2026 | Gemini CLI | 247.45s | $0.110 | 58% | 71% |
Cursor Composer 2.0 Apr 6, 2026 | Cursor | 115.52s | $0.031 | 58% | 71% |
Kimi K2.6 Jun 17, 2026 | OpenCode | 197.69s | $0.057 | 52% | 74% |
Gemini 3.0 Pro Preview Apr 6, 2026 | Gemini CLI | 260.37s | $0.165 | 52% | 65% |
Claude Sonnet 4.6 Apr 6, 2026 | Claude Code | 157.50s | $0.140 | 45% | 74% |
GPT 5.2 Codex (xhigh) Apr 6, 2026 | Codex | 149.60s | $0.150 | 45% | 61% |
Claude Sonnet 4.5 Apr 6, 2026 | Claude Code | 150.53s | $0.130 | 39% | 65% |
MiniMax M2.7 Apr 6, 2026 | OpenCode | 293.14s | $0.026 | 39% | 48% |
Kimi K2.5 Apr 6, 2026 | OpenCode | 134.99s | $0.018 | 16% | 45% |
* AGENTS.md provides bundled Next.js documentation for AI coding agents. The column shows additional evals that passed when agents had access to this documentation.
N/A marks evals a model has never run (newly added evals). They count against the success rate so all models are scored over the same eval set. Reworked evals keep a model's last result until it is rerun.
Success Rate is pass@4: an eval passes if any of four attempts passes. Infrastructure failures are discarded and rerun, never counted.
Avg List Cost: mean cost per eval, from provider-reported token counts (including cache) at the public list prices in effect when the results were exported — some models are on time-limited introductory rates. Rare runs without counts use a length-based estimate. A relative guide, not a bill.