The Eval Index / Agent Eval / #173
THUDM/AgentBench
by THUDM · Agent Eval · updated 7mo ago
A Comprehensive Benchmark to Evaluate LLMs as Agents (ICLR'24)
43
momentum
3,726
stars
279
forks
#173
rank
chatgptgpt-4llmllm-agent
View on GitHub →