Model Benchmarks

Performance of coding agents creating and changing eve projects, measured by deterministic checks against the files, commands, and simulated external interactions each run produces1.

Last published: August 31, 2026eve revision: 450681ad

Current results

Claude Code110.3s$4.37100%100%
Claude Code128.1s$5.60100%100%
Claude Code68.8s$1.20100%100%
Codex122.7s$0.23100%100%
Codex110.4s$0.15100%100%
OpenCode77.4s$0.1486%100%
OpenCode117.7s$0.1186%100%
OpenCode124.5s$0.06100%81%
OpenCode95.5s$0.2157%71%

Retired Models

OpenCode233.1s$0.0719%38%

1 Each model completes the same deterministic eve authoring tasks three times with and without the guidance files generated by eve init; success rates include every scheduled run, while duration, tokens, and tool calls average valid runs. Cost estimates apply provider public list prices to recorded token usage.