❯
llmcoderlab
Leaderboard
Models
Challenges
Findings
Methodology
Harness
Pipeline
Runs
glm4-9b
1 run(s)
15/18 graded
3 failures
← all models
//
score history
Run
Mode
Score
Graded
Failures
run 2
agentic
49.4
9/9
0
run 2
oneshot
87.0
6/9
3
//
every attempt
Run
Mode
Challenge
Score
Tests
Wall
2
agentic
calculator
48.6
1/7
1289s
report
2
agentic
fizzbuzz
76.0
3/5
230s
report
2
agentic
json-pointer
0.0
0/1
323s
report
2
agentic
lru-cache
40.0
0/1
372s
report
2
agentic
palindrome
100.0
5/5
35s
report
2
agentic
temperature
40.0
0/1
368s
report
2
agentic
text-stats
0.0
0/1
535s
report
2
agentic
vowel-count
100.0
5/5
30s
report
2
agentic
word-ladder
40.0
0/5
280s
report
2
oneshot
calculator
degenerate
30s
report
2
oneshot
fizzbuzz
100.0
3/3
12s
report
2
oneshot
json-pointer
82.0
7/10
23s
report
2
oneshot
lru-cache
degenerate
14s
report
2
oneshot
palindrome
100.0
5/5
6s
report
2
oneshot
temperature
100.0
4/4
7s
report
2
oneshot
text-stats
degenerate
17s
report
2
oneshot
vowel-count
100.0
5/5
4s
report
2
oneshot
word-ladder
40.0
0/5
14s
report