Next.js Agent Evals
How well AI coding agents perform real Next.js tasks.
Current evals
Latest agents, rerun whenever the evals change.
Agent | |||||
|---|---|---|---|---|---|
Claude Fable 5 (high) | Claude Code | 255.83s | $2.29 | 88% | 88% |
GPT 5.6 Sol (ultra) | Codex | 336.70s | $0.373 | 88% | 88% |
Claude Opus 5 | Claude Code | 272.21s | $3.14 | 88% | 85% |
Kimi K3 | OpenCode | 369.87s | $0.276 | 81% | 88% |
GLM 5.2 | OpenCode | 413.98s | $0.147 | 77% | 88% |
Claude Sonnet 5 | Claude Code | 234.04s | $0.470 | 77% | 88% |
Cursor Composer 2.5 | Cursor | 244.43s | $0.054 | 77% | 77% |
MiniMax M3 | OpenCode | 225.57s | $0.044 | 73% | 85% |
Kimi K2.7 Code | OpenCode | 251.33s | $0.108 | 69% | 88% |
Previously measured
Superseded agents. Last results, dated — not rerun.
Agent | |||||
|---|---|---|---|---|---|
Grok 4.6 Aug 13, 2026 | OpenCode | 234.68s | $0.160 | 85% | 85% |
GPT 5.3 Codex (xhigh) Aug 27, 2026 | Codex | 286.50s | $0.278 | 81% | 88% |
Claude Opus 4.8 Aug 26, 2026 | Claude Code | 166.84s | $0.358 | 81% | 88% |
Grok 4.5 Jul 8, 2026 | OpenCode | 142.52s | $0.073 | 77% | 88% |
GPT 5.4 (xhigh) Aug 26, 2026 | Codex | 221.56s | $0.241 | 77% | 81% |
GPT 5.5 Pro Aug 26, 2026 | Codex | 774.88s | $18.21 | 77% | 77% |
Claude Opus 4.7 (max) Aug 26, 2026 | Claude Code | 143.55s | $0.454 | 69% | 88% |
Claude Opus 4.6 Aug 26, 2026 | Claude Code | 190.12s | $0.211 | 69% | 88% |
GLM 5.1 Apr 16, 2026 | OpenCode | 253.24s | $0.077 | 69% | 88% |
Cursor Composer 2.0 Aug 26, 2026 | Cursor | 117.66s | $0.032 | 69% | 85% |
Gemini 3.1 Pro Preview Apr 6, 2026 | Gemini CLI | 247.45s | $0.110 | 69% | 85% |
Kimi K2.6 Aug 26, 2026 | OpenCode | 196.63s | $0.058 | 62% | 88% |
Gemini 3.0 Pro Preview Apr 6, 2026 | Gemini CLI | 260.37s | $0.165 | 62% | 77% |
Claude Sonnet 4.6 Aug 26, 2026 | Claude Code | 158.38s | $0.141 | 54% | 88% |
GPT 5.2 Codex (xhigh) Apr 6, 2026 | Codex | 149.60s | $0.150 | 54% | 73% |
Claude Sonnet 4.5 Aug 26, 2026 | Claude Code | 154.34s | $0.131 | 46% | 77% |
MiniMax M2.7 Aug 26, 2026 | OpenCode | 286.90s | $0.026 | 46% | 58% |
Kimi K2.5 Apr 6, 2026 | OpenCode | 134.99s | $0.018 | 19% | 54% |
* AGENTS.md provides bundled Next.js documentation for AI coding agents. The column shows additional evals that passed when agents had access to this documentation.
N/A marks evals a model has never run (newly added evals). They count against the success rate so all models are scored over the same eval set. Reworked evals keep a model's last result until it is rerun.
Success Rate is pass@4: an eval passes if any of four attempts passes. Infrastructure failures are discarded and rerun, never counted.
Avg List Cost: mean cost per eval, from provider-reported token counts (including cache) at public list prices. Rare runs without counts use a length-based estimate. A relative guide, not a bill.