The Eval Index / Agent Eval / #253

AGI-Eval-Official/CATArena

by AGI-Eval-Official · Agent Eval · updated 8mo ago

CATArena is an engineering-level tournament evaluation platform for Large Language Model-driven code agents (LLM-driven code agents), based on an iterative competitive peer learning framework.

22
momentum
68
stars
11
forks
#253
rank
View on GitHub →