The Eval Index / Reasoning / #219
stalkermustang/llm-bulls-and-cows-benchmark
by stalkermustang · Reasoning · updated 1y ago
A mini-framework for evaluating LLM performance on the Bulls and Cows number guessing game, supporting multiple LLM providers.
29
momentum
235
stars
2
forks
#219
rank
benchmarkbenchmarkingchatgptgamesllmopenaipythonreasoning
View on GitHub →