The Eval Index / Benchmarks / #188

OpenGenerativeAI/llm-colosseum

by OpenGenerativeAI · Benchmarks · updated 1y ago

Benchmark LLMs by fighting in Street Fighter 3! The new way to evaluate the quality of an LLM

38
momentum
1,483
stars
182
forks
#188
rank
benchmarkgenaillmstreetfighterai
View on GitHub →