The Eval Index / Reasoning / #219

stalkermustang/llm-bulls-and-cows-benchmark

by stalkermustang · Reasoning · updated 1y ago

A mini-framework for evaluating LLM performance on the Bulls and Cows number guessing game, supporting multiple LLM providers.

29
momentum
235
stars
2
forks
#219
rank
benchmarkbenchmarkingchatgptgamesllmopenaipythonreasoning
View on GitHub →