Что такое LLM-as-a-Judge
LLM-as-a-Judge использует отдельную модель для оценки ответа другой модели по заранее заданным критериям. Это ускоряет evals, но не заменяет human review.
Сначала зафиксируйте rubric
Критерии должны быть наблюдаемыми: correctness, completeness, groundedness, safety, format compliance. Для каждого критерия задайте шкалу и примеры.
Pointwise и pairwise evaluation
Pointwise scoring оценивает один ответ по шкале, pairwise сравнивает два ответа и часто лучше выявляет относительное улучшение между версиями.
Blind evaluation
Judge не должен видеть название модели, вариант prompt или experiment arm, если эти данные могут создать bias.
Калибровка по human labels
Соберите небольшой gold set с human оценками и измеряйте agreement judge-модели с людьми до автоматизации больших прогонов.
Типичные bias
Judge может предпочитать длинные ответы, собственный стиль, известную модель или уверенный тон. Проверяйте position bias, verbosity bias и self-preference.
Structured output для judge
Возвращайте score, reason, evidence и confidence по JSON Schema, чтобы eval pipeline мог валидировать результат и строить метрики.
Когда нужен human review
Низкий confidence, safety-sensitive кейсы, спорные pairwise решения и новые классы ошибок должны уходить человеку.
Regression gates
Сравнивайте новую версию с baseline на фиксированном наборе и блокируйте rollout при падении критичных метрик.
Как использовать несколько judges
Для важных задач можно применять несколько judge-моделей или повторные прогоны и анализировать disagreement вместо слепой веры в один score.
Production checklist
Версионируйте rubric и judge prompt, сохраняйте raw outputs, model/version, latency и cost, контролируйте drift и периодически перекалибровывайте на human labels.