The Eval Index / Benchmarks / #259

multinear/multinear

by multinear · Benchmarks · updated 1y ago

Develop reliable AI apps

20
momentum
46
stars
1
forks
#259
rank
evaluationllmllm-evalllm-evaluationllm-evaluation-frameworkllmsllms-benchmarkingreliability
View on GitHub →