Skip to content
Skip to content

Next.js Agent Evals

How well AI coding agents perform real Next.js tasks.

View on GitHub
Last run date: August 27, 2026

Current evals

Latest agents, rerun whenever the evals change.

Agent
Claude Fable 5 (high)
Claude Code
255.83s
$2.29
88%
88%
GPT 5.6 Sol (ultra)
Codex
336.70s
$0.373
88%
88%
Claude Opus 5
Claude Code
272.21s
$3.14
88%
85%
Kimi K3
OpenCode
369.87s
$0.276
81%
88%
GLM 5.2
OpenCode
413.98s
$0.147
77%
88%
Claude Sonnet 5
Claude Code
234.04s
$0.470
77%
88%
Cursor Composer 2.5
Cursor
244.43s
$0.054
77%
77%
MiniMax M3
OpenCode
225.57s
$0.044
73%
85%
Kimi K2.7 Code
OpenCode
251.33s
$0.108
69%
88%

Previously measured

Superseded agents. Last results, dated — not rerun.

Agent
Grok 4.6 Aug 13, 2026
OpenCode
234.68s
$0.160
85%
85%
GPT 5.3 Codex (xhigh) Aug 27, 2026
Codex
286.50s
$0.278
81%
88%
Claude Opus 4.8 Aug 26, 2026
Claude Code
166.84s
$0.358
81%
88%
Grok 4.5 Jul 8, 2026
OpenCode
142.52s
$0.073
77%
88%
GPT 5.4 (xhigh) Aug 26, 2026
Codex
221.56s
$0.241
77%
81%
GPT 5.5 Pro Aug 26, 2026
Codex
774.88s
$18.21
77%
77%
Claude Opus 4.7 (max) Aug 26, 2026
Claude Code
143.55s
$0.454
69%
88%
Claude Opus 4.6 Aug 26, 2026
Claude Code
190.12s
$0.211
69%
88%
GLM 5.1 Apr 16, 2026
OpenCode
253.24s
$0.077
69%
88%
Cursor Composer 2.0 Aug 26, 2026
Cursor
117.66s
$0.032
69%
85%
Gemini 3.1 Pro Preview Apr 6, 2026
Gemini CLI
247.45s
$0.110
69%
85%
Kimi K2.6 Aug 26, 2026
OpenCode
196.63s
$0.058
62%
88%
Gemini 3.0 Pro Preview Apr 6, 2026
Gemini CLI
260.37s
$0.165
62%
77%
Claude Sonnet 4.6 Aug 26, 2026
Claude Code
158.38s
$0.141
54%
88%
GPT 5.2 Codex (xhigh) Apr 6, 2026
Codex
149.60s
$0.150
54%
73%
Claude Sonnet 4.5 Aug 26, 2026
Claude Code
154.34s
$0.131
46%
77%
MiniMax M2.7 Aug 26, 2026
OpenCode
286.90s
$0.026
46%
58%
Kimi K2.5 Apr 6, 2026
OpenCode
134.99s
$0.018
19%
54%

* AGENTS.md provides bundled Next.js documentation for AI coding agents. The column shows additional evals that passed when agents had access to this documentation.

N/A marks evals a model has never run (newly added evals). They count against the success rate so all models are scored over the same eval set. Reworked evals keep a model's last result until it is rerun.

Success Rate is pass@4: an eval passes if any of four attempts passes. Infrastructure failures are discarded and rerun, never counted.

Avg List Cost: mean cost per eval, from provider-reported token counts (including cache) at public list prices. Rare runs without counts use a length-based estimate. A relative guide, not a bill.