ZooWork Market · Skill
ai-evaluation-framework
Builds systematic evaluation pipelines to measure LLM output quality, catch regressions, and make data-driven decisions about model or prompt changes. Use when you need to know if your AI feature is actually working well. Triggers on: LLM evaluation, AI quality, prompt testing, model comparison, evals, AI benchmark, output quality, regression testing AI.