❯
llmcoderlab
Leaderboard
Models
Challenges
Findings
Methodology
Harness
Pipeline
Runs
llama3.2-3b
1 run(s)
16/18 graded
2 failures
← all models
//
score history
Run
Mode
Score
Graded
Failures
run 2
agentic
77.9
9/9
0
run 2
oneshot
91.4
7/9
2
//
every attempt
Run
Mode
Challenge
Score
Tests
Wall
2
agentic
calculator
91.4
6/7
295s
report
2
agentic
fizzbuzz
100.0
3/3
8s
report
2
agentic
json-pointer
82.0
7/10
305s
report
2
agentic
lru-cache
76.0
3/5
111s
report
2
agentic
palindrome
100.0
5/5
5s
report
2
agentic
temperature
100.0
4/4
5s
report
2
agentic
text-stats
0.0
0/1
67s
report
2
agentic
vowel-count
100.0
5/5
4s
report
2
agentic
word-ladder
52.0
1/5
119s
report
2
oneshot
calculator
40.0
0/1
12s
report
2
oneshot
fizzbuzz
100.0
3/3
4s
report
2
oneshot
json-pointer
degenerate
7s
report
2
oneshot
lru-cache
100.0
5/5
6s
report
2
oneshot
palindrome
100.0
5/5
3s
report
2
oneshot
temperature
100.0
4/4
3s
report
2
oneshot
text-stats
degenerate
6s
report
2
oneshot
vowel-count
100.0
5/5
2s
report
2
oneshot
word-ladder
100.0
5/5
9s
report