ZooWork
ZooWork Market · Skill

ai-evaluation-framework

Builds systematic evaluation pipelines to measure LLM output quality, catch regressions, and make data-driven decisions about model or prompt changes. Use when you need to know if your AI feature is actually working well. Triggers on: LLM evaluation, AI quality, prompt testing, model comparison, evals, AI benchmark, output quality, regression testing AI.

◇
sharp-skills
sharp-skills-skills-ai-evaluation-framework · v1.0.1
分类ai-llms
安装次数11
更新时间2026-09-01T17:17:28.462Z
校验状态待验证