Test your prompts, models, RAGs. Evaluate and compare LLM outputs, catch regressions, and improve prompt quality. - View it on GitHub
Star
1
Rank
6255410