Historical multi-task benchmark · Provisional

Phase 2: Repository Navigation

One of five Phase 2 task rankings. This table faithfully reproduces the 31 recorded results for repository navigation, including public and hidden pass status, four-dimensional expert review, measured solution time, and execution-record status fields.

This is provisional historical evidence, not part of the current isolated ranking. See the retry-policy patch results or the benchmark index.

Historical / Provisional — not a blind benchmark
31candidates / records
146public passes, all tasks
134hidden passes, all tasks
0forbidden changes

Complete candidate results

Activate any column heading to sort. Activate it again to reverse direction.

31 rows

All 31 Phase 2 repository navigation candidate records.
1 opencode-go/grok-4.509-grok-4-5 pass pass 10 10 9 10 9.75 19.921 completed 0 0 record ↗
2 opencode-go/minimax-m2.717-minimax-m2-7 pass pass 10 10 9 10 9.75 24.929 completed 0 0 record ↗
3 opencode/claude-sonnet-552-claude-sonnet-5 pass pass 10 10 9 10 9.75 27.616 completed 0 0 record ↗
4 opencode-go/deepseek-v4-pro04-deepseek-v4-pro pass pass 10 10 9 10 9.75 29.399 completed 0 0 record ↗
5 opencode-go/hy314-hy3 pass pass 10 10 9 10 9.75 29.875 completed 0 0 record ↗
6 opencode-go/gpt-5.6-luna01-gpt-5-6-luna pass pass 10 10 9 10 9.75 30.944 completed 0 0 record ↗
7 opencode/big-pickle19-big-pickle pass pass 10 10 9 10 9.75 31.056 completed 0 0 record ↗
8 opencode/deepseek-v4-flash-free22-deepseek-v4-flash-free pass pass 10 10 9 10 9.75 37.341 completed 0 0 record ↗
9 gpt-5.3-codex-spark18-gpt-5-3-codex-spark pass pass 10 10 9 10 9.75 41.755 completed 0 0 record ↗
10 opencode-go/kimi-k2.7-code03-kimi-k2-7-code pass pass 10 10 9 10 9.75 46.924 completed 0 0 record ↗
11 opencode-go/mimo-v2.513-mimo-v2-5 pass pass 10 10 9 10 9.75 49.640 completed 0 0 record ↗
12 opencode-go/glm-5.115-glm-5-1 pass pass 10 10 9 10 9.75 50.879 completed 0 0 record ↗
13 opencode-go/minimax-m306-minimax-m3 pass pass 10 10 9 10 9.75 54.286 completed 0 0 record ↗
14 opencode-go/deepseek-v4-flash11-deepseek-v4-flash pass pass 10 10 9 10 9.75 68.151 completed 0 0 record ↗
15 opencode-go/glm-5.205-glm-5-2 pass pass 10 10 9 10 9.75 72.911 completed 0 0 record ↗
16 gpt-5.6-terra48-gpt-5-6-terra pass pass 10 10 9 10 9.75 83.706 completed 0 0 record ↗
17 gpt-5.6-luna46-gpt-5-6-luna pass pass 10 10 9 10 9.75 88.862 completed 0 0 record ↗
18 gpt-5.6-sol47-gpt-5-6-sol pass pass 10 10 9 10 9.75 90.212 completed 0 0 record ↗
19 opencode/laguna-s-2.1-free20-laguna-s-2-1-free pass pass 10 10 9 10 9.75 91.453 completed 0 0 record ↗
20 opencode/claude-opus-553-claude-opus-5 pass pass 10 10 9 10 9.75 92.637 completed 0 0 record ↗
21 gpt-5.4-mini50-gpt-5-4-mini pass pass 10 10 9 10 9.75 102.160 completed 0 0 record ↗
22 gpt-5.449-gpt-5-4 pass pass 10 10 9 10 9.75 108.386 completed 0 0 record ↗
23 opencode-go/kimi-k2.616-kimi-k2-6 pass pass 10 10 9 10 9.75 117.523 completed 0 0 record ↗
24 opencode-go/kimi-k310-kimi-k3 pass pass 10 10 9 10 9.75 158.236 completed 0 0 record ↗
25 opencode/mimo-v2.5-free28-mimo-v2-5-free pass pass 10 10 9 10 9.75 158.413 completed 0 0 record ↗
26 opencode-go/mimo-v2.5-pro07-mimo-v2-5-pro pass pass 10 10 9 10 9.75 166.714 completed 0 0 record ↗
27 opencode/hy3-free27-hy3-free pass pass 10 10 8 10 9.50 34.518 completed 0 0 record ↗
28 opencode/claude-haiku-4-551-claude-haiku-4-5 pass pass 10 10 7 10 9.25 40.889 completed 0 0 record ↗
29 opencode/nemotron-3.5-lightning-free33-nemotron-3-5-lightning-free pass fail 7 5 9 10 7.75 61.667 completed 0 1 record ↗
N/A opencode/nemotron-3-ultra-free35-nemotron-3-ultra-free fail fail N/A N/A N/A N/A N/A 63.585 completed 1 1 record ↗
N/A opencode-go/qwen3.7-plus02-qwen3-7-plus fail fail N/A N/A N/A N/A N/A 900.004 completed — 1 record ↗

Source data and evidence

Generated from the Phase 2 records and expert reviews at commit f6e0d4ed4df2690f66b66d656012238d9cfe5add. Times are agent wall-clock solution durations. Public and hidden results remain separate objective evidence; expert scores use four 0–10 criteria and Overall is their arithmetic mean. No-patch outcomes remain N/A and do not count as code-quality failures.