The Eval Index / Reasoning / #272
IAAR-Shanghai/GuessArena
by IAAR-Shanghai · Reasoning · updated 10mo ago
[ACL 2025] GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning
13
momentum
10
stars
0
forks
#272
rank
benchmarkchatgptdeepseekdomain-specific-evalevaluation-frameworkgamearenaguessarenaknowledge-evaluationlarge-language-modelsllm-evalopenaiqwen
View on GitHub →