The Eval Index / Reasoning / #272

IAAR-Shanghai/GuessArena

by IAAR-Shanghai · Reasoning · updated 10mo ago

[ACL 2025] GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning

13
momentum
10
stars
0
forks
#272
rank
benchmarkchatgptdeepseekdomain-specific-evalevaluation-frameworkgamearenaguessarenaknowledge-evaluationlarge-language-modelsllm-evalopenaiqwen
View on GitHub →