llmcoderlab

Leaderboard

Mean blended score (0–100) per model and mode over the latest run. Failed attempts (transport errors, degenerate output, protocol violations) are excluded from scores and counted separately — never as zeros. Click any run for the full engineer report on every attempt, or see all runs and how scoring works.

Models on the board
4
latest run 2
Challenges
9
53 tests total
Attempts (latest run)
72
56 graded · 16 failed
All-time attempts
82
2 run(s)
🥇 qwen3-30b-a3b agentic
tests100%
deliverables100%
content checks100%
5/9
graded
4
failures
5290s
wall time
28.0k
tokens out
qwen3-30b-a3b oneshot
tests100%
deliverables100%
content checks100%
7/9
graded
2
failures
3022s
wall time
18.1k
tokens out
🥈 llama3.2-3b oneshot
tests86%
deliverables100%
content checks100%
7/9
graded
2
failures
53s
wall time
1.2k
tokens out
🥉 qwen2.5-coder-3b oneshot
tests79%
deliverables100%
content checks100%
4/9
graded
5
failures
71s
wall time
1.7k
tokens out
glm4-9b oneshot
tests78%
deliverables100%
content checks100%
6/9
graded
3
failures
127s
wall time
1.4k
tokens out
llama3.2-3b agentic
tests71%
deliverables89%
content checks89%
9/9
graded
0
failures
918s
wall time
16.4k
tokens out
tests46%
deliverables56%
content checks56%
9/9
graded
0
failures
1663s
wall time
39.6k
tokens out
glm4-9b agentic
tests30%
deliverables78%
content checks78%
9/9
graded
0
failures
3461s
wall time
38.3k
tokens out