Phase 2: Bug Fixing
One of five Phase 2 task rankings. This table faithfully reproduces the 31 recorded results for bug fixing, including public and hidden pass status, four-dimensional expert review, measured solution time, and execution-record status fields.
This is provisional historical evidence, not part of the current isolated ranking. See the retry-policy patch results or the benchmark index.
Complete candidate results
Activate any column heading to sort. Activate it again to reverse direction.
31 rows
| 1 | opencode-go/deepseek-v4-pro04-deepseek-v4-pro | pass | pass | 10 | 10 | 9 | 10 | 9.75 | 46.595 | completed | 0 | 0 | record ↗ |
| 2 | opencode-go/deepseek-v4-flash11-deepseek-v4-flash | pass | pass | 10 | 10 | 9 | 10 | 9.75 | 47.004 | completed | 0 | 0 | record ↗ |
| 3 | opencode/hy3-free27-hy3-free | pass | pass | 10 | 10 | 9 | 10 | 9.75 | 51.484 | completed | 0 | 0 | record ↗ |
| 4 | opencode/claude-sonnet-552-claude-sonnet-5 | pass | pass | 10 | 10 | 9 | 10 | 9.75 | 140.629 | completed | 0 | 0 | record ↗ |
| 5 | opencode-go/kimi-k2.7-code03-kimi-k2-7-code | pass | pass | 10 | 10 | 9 | 10 | 9.75 | 155.422 | completed | 0 | 0 | record ↗ |
| 6 | opencode-go/glm-5.205-glm-5-2 | pass | pass | 10 | 10 | 9 | 10 | 9.75 | 181.040 | completed | 0 | 0 | record ↗ |
| 7 | opencode-go/glm-5.115-glm-5-1 | pass | pass | 10 | 10 | 9 | 10 | 9.75 | 274.884 | completed | 0 | 0 | record ↗ |
| 8 | opencode-go/gpt-5.6-luna01-gpt-5-6-luna | pass | pass | 10 | 10 | 8 | 10 | 9.50 | 41.504 | completed | 0 | 0 | record ↗ |
| 9 | opencode-go/grok-4.509-grok-4-5 | pass | pass | 10 | 10 | 8 | 10 | 9.50 | 41.759 | completed | 0 | 0 | record ↗ |
| 10 | gpt-5.3-codex-spark18-gpt-5-3-codex-spark | pass | pass | 10 | 10 | 8 | 10 | 9.50 | 56.334 | completed | 0 | 0 | record ↗ |
| 11 | gpt-5.6-terra48-gpt-5-6-terra | pass | pass | 10 | 10 | 8 | 10 | 9.50 | 74.276 | completed | 0 | 0 | record ↗ |
| 12 | opencode/deepseek-v4-flash-free22-deepseek-v4-flash-free | pass | pass | 10 | 10 | 8 | 10 | 9.50 | 84.145 | completed | 0 | 0 | record ↗ |
| 13 | opencode-go/mimo-v2.5-pro07-mimo-v2-5-pro | pass | pass | 10 | 10 | 8 | 10 | 9.50 | 96.530 | completed | 0 | 0 | record ↗ |
| 14 | opencode-go/kimi-k2.616-kimi-k2-6 | pass | pass | 10 | 10 | 8 | 10 | 9.50 | 96.910 | completed | 0 | 0 | record ↗ |
| 15 | opencode/claude-opus-553-claude-opus-5 | pass | pass | 10 | 10 | 8 | 10 | 9.50 | 126.937 | completed | 0 | 0 | record ↗ |
| 16 | gpt-5.449-gpt-5-4 | pass | pass | 10 | 10 | 8 | 10 | 9.50 | 166.840 | completed | 0 | 0 | record ↗ |
| 17 | opencode-go/kimi-k310-kimi-k3 | pass | pass | 10 | 10 | 8 | 10 | 9.50 | 197.411 | completed | 0 | 0 | record ↗ |
| 18 | opencode-go/minimax-m306-minimax-m3 | pass | pass | 10 | 10 | 8 | 10 | 9.50 | 199.644 | completed | 0 | 0 | record ↗ |
| 19 | gpt-5.4-mini50-gpt-5-4-mini | pass | pass | 10 | 10 | 8 | 10 | 9.50 | 211.386 | completed | 0 | 0 | record ↗ |
| 20 | gpt-5.6-sol47-gpt-5-6-sol | pass | pass | 10 | 10 | 7 | 10 | 9.25 | 120.570 | completed | 0 | 0 | record ↗ |
| 21 | gpt-5.6-luna46-gpt-5-6-luna | pass | pass | 10 | 10 | 7 | 10 | 9.25 | 404.343 | completed | 0 | 0 | record ↗ |
| 22 | opencode-go/mimo-v2.513-mimo-v2-5 | pass | fail | 7 | 5 | 9 | 10 | 7.75 | 114.588 | completed | 0 | 1 | record ↗ |
| 23 | opencode/nemotron-3-ultra-free35-nemotron-3-ultra-free | pass | fail | 5 | 3 | 9 | 10 | 6.75 | 38.511 | completed | 0 | 1 | record ↗ |
| 24 | opencode/claude-haiku-4-551-claude-haiku-4-5 | pass | fail | 5 | 3 | 9 | 10 | 6.75 | 46.499 | completed | 0 | 1 | record ↗ |
| 25 | opencode-go/hy314-hy3 | pass | fail | 5 | 3 | 9 | 10 | 6.75 | 49.301 | completed | 0 | 1 | record ↗ |
| 26 | opencode/big-pickle19-big-pickle | pass | fail | 5 | 3 | 9 | 10 | 6.75 | 55.931 | completed | 0 | 1 | record ↗ |
| 27 | opencode-go/minimax-m2.717-minimax-m2-7 | pass | fail | 5 | 3 | 9 | 10 | 6.75 | 60.837 | completed | 0 | 1 | record ↗ |
| 28 | opencode/nemotron-3.5-lightning-free33-nemotron-3-5-lightning-free | pass | fail | 5 | 3 | 9 | 10 | 6.75 | 96.799 | completed | 0 | 1 | record ↗ |
| 29 | opencode/mimo-v2.5-free28-mimo-v2-5-free | pass | fail | 5 | 3 | 9 | 10 | 6.75 | 290.305 | completed | 0 | 1 | record ↗ |
| N/A | opencode/laguna-s-2.1-free20-laguna-s-2-1-free | fail | fail | N/A | N/A | N/A | N/A | N/A | 302.473 | completed | 1 | 1 | record ↗ |
| N/A | opencode-go/qwen3.7-plus02-qwen3-7-plus | fail | fail | N/A | N/A | N/A | N/A | N/A | 900.105 | completed | — | 1 | record ↗ |
Source data and evidence
Generated from the Phase 2 records and expert reviews at commit
f6e0d4ed4df2690f66b66d656012238d9cfe5add. Times are
agent wall-clock solution durations. Public and hidden results
remain separate objective evidence; expert scores use four 0–10
criteria and Overall is their arithmetic mean. No-patch outcomes
remain N/A and do not count as code-quality failures.