Model Benchmarks

Performance of coding agents creating and changing eve projects, measured by deterministic checks against the files, commands, and simulated external interactions each run produces1.

Last published: September 2, 2026eve revision: 78fa9046

Current results

Claude Code154.4s$1.01100%100%
Claude Code139.1s$0.86100%100%
Claude Code125.2s$0.35100%100%
OpenCode195.8s$0.08100%100%
Codex122.7s$0.23100%100%
Codex110.4s$0.15100%100%
OpenCode77.4s$0.1486%100%
OpenCode117.7s$0.1186%100%
OpenCode95.5s$0.2157%71%

Retired Models

Claude Code110.3s$4.37100%100%
OpenCode124.5s$0.06100%81%
OpenCode233.1s$0.0719%38%

1 Each model completes the same deterministic eve authoring tasks three times with and without the guidance files generated by eve init; success rates include every scheduled run, while duration, tokens, and tool calls average valid runs. Cost estimates apply provider public list prices to recorded token usage.