Historical multi-task benchmark · Provisional

Phase 2: Tests / Edge Cases

One of five Phase 2 task rankings. This table faithfully reproduces the 31 recorded results for tests / edge cases, including public and hidden pass status, four-dimensional expert review, measured solution time, and execution-record status fields.

This is provisional historical evidence, not part of the current isolated ranking. See the retry-policy patch results or the benchmark index.

Historical / Provisional — not a blind benchmark
31candidates / records
146public passes, all tasks
134hidden passes, all tasks
0forbidden changes

Complete candidate results

Activate any column heading to sort. Activate it again to reverse direction.

31 rows

All 31 Phase 2 tests / edge cases candidate records.
1 opencode-go/grok-4.509-grok-4-5 pass pass 10 10 9 10 9.75 28.477 completed 0 0 record ↗
2 opencode/nemotron-3.5-lightning-free33-nemotron-3-5-lightning-free pass pass 10 10 9 10 9.75 39.326 completed 0 0 record ↗
3 opencode-go/gpt-5.6-luna01-gpt-5-6-luna pass pass 10 10 9 10 9.75 52.234 completed 0 0 record ↗
4 opencode/deepseek-v4-flash-free22-deepseek-v4-flash-free pass pass 10 10 9 10 9.75 58.618 completed 0 0 record ↗
5 opencode-go/deepseek-v4-pro04-deepseek-v4-pro pass pass 10 10 9 10 9.75 64.140 completed 0 0 record ↗
6 gpt-5.3-codex-spark18-gpt-5-3-codex-spark pass pass 10 10 9 10 9.75 68.554 completed 0 0 record ↗
7 opencode/hy3-free27-hy3-free pass pass 10 10 9 10 9.75 72.581 completed 0 0 record ↗
8 opencode/big-pickle19-big-pickle pass pass 10 10 9 10 9.75 73.032 completed 0 0 record ↗
9 opencode/claude-sonnet-552-claude-sonnet-5 pass pass 10 10 9 10 9.75 80.832 completed 0 0 record ↗
10 opencode/claude-haiku-4-551-claude-haiku-4-5 pass pass 10 10 9 10 9.75 97.143 completed 0 0 record ↗
11 opencode-go/deepseek-v4-flash11-deepseek-v4-flash pass pass 10 10 9 10 9.75 99.957 completed 0 0 record ↗
12 opencode-go/glm-5.205-glm-5-2 pass pass 10 10 9 10 9.75 105.336 completed 0 0 record ↗
13 gpt-5.4-mini50-gpt-5-4-mini pass pass 10 10 9 10 9.75 107.981 completed 0 0 record ↗
14 opencode-go/minimax-m306-minimax-m3 pass pass 10 10 9 10 9.75 111.159 completed 0 0 record ↗
15 opencode-go/kimi-k2.616-kimi-k2-6 pass pass 10 10 9 10 9.75 118.646 completed 0 0 record ↗
16 gpt-5.449-gpt-5-4 pass pass 10 10 9 10 9.75 122.987 completed 0 0 record ↗
17 gpt-5.6-terra48-gpt-5-6-terra pass pass 10 10 9 10 9.75 131.405 completed 0 0 record ↗
18 opencode/nemotron-3-ultra-free35-nemotron-3-ultra-free pass pass 10 10 9 10 9.75 162.129 completed 0 0 record ↗
19 gpt-5.6-sol47-gpt-5-6-sol pass pass 10 10 9 10 9.75 186.860 completed 0 0 record ↗
20 gpt-5.6-luna46-gpt-5-6-luna pass pass 10 10 9 10 9.75 201.828 completed 0 0 record ↗
21 opencode-go/hy314-hy3 pass pass 10 10 8 10 9.50 53.038 completed 0 0 record ↗
22 opencode-go/mimo-v2.513-mimo-v2-5 pass pass 10 10 8 10 9.50 105.210 completed 0 0 record ↗
23 opencode-go/kimi-k2.7-code03-kimi-k2-7-code pass pass 10 10 8 10 9.50 119.338 completed 0 0 record ↗
24 opencode-go/mimo-v2.5-pro07-mimo-v2-5-pro pass pass 10 10 8 10 9.50 129.299 completed 0 0 record ↗
25 opencode/mimo-v2.5-free28-mimo-v2-5-free pass pass 10 10 8 10 9.50 196.620 completed 0 0 record ↗
26 opencode-go/glm-5.115-glm-5-1 pass pass 10 10 8 10 9.50 216.571 completed 0 0 record ↗
27 opencode-go/kimi-k310-kimi-k3 pass pass 10 10 8 10 9.50 318.287 completed 0 0 record ↗
28 opencode/laguna-s-2.1-free20-laguna-s-2-1-free pass pass 10 10 8 10 9.50 766.237 completed 0 0 record ↗
29 opencode/claude-opus-553-claude-opus-5 pass pass 10 10 7 10 9.25 171.824 completed 0 0 record ↗
30 opencode-go/minimax-m2.717-minimax-m2-7 pass fail 8 6 9 10 8.25 224.592 completed 0 1 record ↗
N/A opencode-go/qwen3.7-plus02-qwen3-7-plus fail fail N/A N/A N/A N/A N/A 900.003 completed — 1 record ↗

Source data and evidence

Generated from the Phase 2 records and expert reviews at commit f6e0d4ed4df2690f66b66d656012238d9cfe5add. Times are agent wall-clock solution durations. Public and hidden results remain separate objective evidence; expert scores use four 0–10 criteria and Overall is their arithmetic mean. No-patch outcomes remain N/A and do not count as code-quality failures.