Historical multi-task benchmark · Provisional

Phase 2: Feature Implementation

One of five Phase 2 task rankings. This table faithfully reproduces the 31 recorded results for feature implementation, including public and hidden pass status, four-dimensional expert review, measured solution time, and execution-record status fields.

This is provisional historical evidence, not part of the current isolated ranking. See the retry-policy patch results or the benchmark index.

Historical / Provisional — not a blind benchmark
31candidates / records
146public passes, all tasks
134hidden passes, all tasks
0forbidden changes

Complete candidate results

Activate any column heading to sort. Activate it again to reverse direction.

31 rows

All 31 Phase 2 feature implementation candidate records.
1 opencode-go/gpt-5.6-luna01-gpt-5-6-luna pass pass 10 10 9 10 9.75 31.443 completed 0 0 record ↗
2 opencode/deepseek-v4-flash-free22-deepseek-v4-flash-free pass pass 10 10 9 10 9.75 31.790 completed 0 0 record ↗
3 opencode-go/deepseek-v4-flash11-deepseek-v4-flash pass pass 10 10 9 10 9.75 32.054 completed 0 0 record ↗
4 opencode/nemotron-3.5-lightning-free33-nemotron-3-5-lightning-free pass pass 10 10 9 10 9.75 35.533 completed 0 0 record ↗
5 opencode-go/mimo-v2.513-mimo-v2-5 pass pass 10 10 9 10 9.75 40.862 completed 0 0 record ↗
6 opencode-go/hy314-hy3 pass pass 10 10 9 10 9.75 46.745 completed 0 0 record ↗
7 opencode-go/deepseek-v4-pro04-deepseek-v4-pro pass pass 10 10 9 10 9.75 50.049 completed 0 0 record ↗
8 opencode-go/mimo-v2.5-pro07-mimo-v2-5-pro pass pass 10 10 9 10 9.75 64.832 completed 0 0 record ↗
9 opencode/big-pickle19-big-pickle pass pass 10 10 9 10 9.75 66.624 completed 0 0 record ↗
10 opencode/nemotron-3-ultra-free35-nemotron-3-ultra-free pass pass 10 10 9 10 9.75 70.236 completed 0 0 record ↗
11 opencode-go/kimi-k2.616-kimi-k2-6 pass pass 10 10 9 10 9.75 70.755 completed 0 0 record ↗
12 opencode-go/minimax-m2.717-minimax-m2-7 pass pass 10 10 9 10 9.75 71.515 completed 0 0 record ↗
13 opencode-go/kimi-k2.7-code03-kimi-k2-7-code pass pass 10 10 9 10 9.75 72.802 completed 0 0 record ↗
14 opencode-go/minimax-m306-minimax-m3 pass pass 10 10 9 10 9.75 74.805 completed 0 0 record ↗
15 opencode-go/glm-5.115-glm-5-1 pass pass 10 10 9 10 9.75 77.988 completed 0 0 record ↗
16 gpt-5.4-mini50-gpt-5-4-mini pass pass 10 10 9 10 9.75 89.598 completed 0 0 record ↗
17 gpt-5.6-terra48-gpt-5-6-terra pass pass 10 10 9 10 9.75 91.050 completed 0 0 record ↗
18 gpt-5.449-gpt-5-4 pass pass 10 10 9 10 9.75 104.601 completed 0 0 record ↗
19 gpt-5.6-sol47-gpt-5-6-sol pass pass 10 10 9 10 9.75 124.952 completed 0 0 record ↗
20 opencode-go/kimi-k310-kimi-k3 pass pass 10 10 9 10 9.75 126.450 completed 0 0 record ↗
21 opencode-go/glm-5.205-glm-5-2 pass pass 10 10 9 10 9.75 137.401 completed 0 0 record ↗
22 gpt-5.6-luna46-gpt-5-6-luna pass pass 10 10 9 10 9.75 198.943 completed 0 0 record ↗
23 opencode/claude-opus-553-claude-opus-5 pass pass 10 10 9 10 9.75 272.223 completed 0 0 record ↗
24 opencode-go/grok-4.509-grok-4-5 pass pass 10 10 8 10 9.50 26.753 completed 0 0 record ↗
25 opencode/claude-sonnet-552-claude-sonnet-5 pass pass 10 10 8 10 9.50 55.312 completed 0 0 record ↗
26 opencode/claude-haiku-4-551-claude-haiku-4-5 pass pass 10 10 7 10 9.25 51.422 completed 0 0 record ↗
27 gpt-5.3-codex-spark18-gpt-5-3-codex-spark pass pass 10 10 7 10 9.25 59.541 completed 0 0 record ↗
28 opencode/mimo-v2.5-free28-mimo-v2-5-free pass fail 7 5 9 10 7.75 123.672 completed 0 1 record ↗
29 opencode/hy3-free27-hy3-free pass fail 7 5 8 10 7.50 34.860 completed 0 1 record ↗
N/A opencode-go/qwen3.7-plus02-qwen3-7-plus fail fail N/A N/A N/A N/A N/A 900.003 completed — 1 record ↗
N/A opencode/laguna-s-2.1-free20-laguna-s-2-1-free fail fail N/A N/A N/A N/A N/A 900.081 completed — 1 record ↗

Source data and evidence

Generated from the Phase 2 records and expert reviews at commit f6e0d4ed4df2690f66b66d656012238d9cfe5add. Times are agent wall-clock solution durations. Public and hidden results remain separate objective evidence; expert scores use four 0–10 criteria and Overall is their arithmetic mean. No-patch outcomes remain N/A and do not count as code-quality failures.