Model Benchmarks

Performance of coding agents creating and changing eve projects, measured by deterministic checks against the files, commands, and simulated external interactions each run produces1.

Last published: October 8, 2026eve revision: 279e2b6a

Current results

Claude Code218.6s$1.03100%100%
Claude Code152.8s$0.33100%100%
Claude Code122.4s$0.29100%100%
OpenCode319.6s$0.0990%100%
Codex125.4s$0.16100%100%
Codex159.9s$0.86100%100%
Codex157.4s$0.22100%100%
OpenCode163.1s$0.1486%100%
OpenCode176.3s$0.0890%100%
OpenCode160.5s$0.17100%100%
OpenCode141.3s$0.0390%100%
Codex151.9s$0.0195%95%
OpenCode176.3s$0.2286%90%
OpenCode302.3s$0.43100%90%

Retired Models

Claude Code110.3s$4.37100%100%
Claude Code139.1s$0.86100%100%
Codex122.7s$0.23100%100%
OpenCode77.4s$0.1486%100%
OpenCode184.9s$0.1162%90%
OpenCode233.1s$0.0719%38%

1 Each model completes the same deterministic eve authoring tasks three times with and without the guidance files generated by eve init; success rates include every scheduled run, while duration, tokens, and tool calls average valid runs. Cost estimates apply provider public list prices to recorded token usage.