The Eval Index / Benchmarks / #188
OpenGenerativeAI/llm-colosseum
by OpenGenerativeAI · Benchmarks · updated 1y ago
Benchmark LLMs by fighting in Street Fighter 3! The new way to evaluate the quality of an LLM
38
momentum
1,483
stars
182
forks
#188
rank
benchmarkgenaillmstreetfighterai
View on GitHub →