Что такое LLM-as-a-Judge

LLM-as-a-Judge использует отдельную модель для оценки ответа другой модели по заранее заданным критериям. Это ускоряет evals, но не заменяет human review.

Сначала зафиксируйте rubric

Критерии должны быть наблюдаемыми: correctness, completeness, groundedness, safety, format compliance. Для каждого критерия задайте шкалу и примеры.

Pointwise и pairwise evaluation

Pointwise scoring оценивает один ответ по шкале, pairwise сравнивает два ответа и часто лучше выявляет относительное улучшение между версиями.

Blind evaluation

Judge не должен видеть название модели, вариант prompt или experiment arm, если эти данные могут создать bias.

Калибровка по human labels

Соберите небольшой gold set с human оценками и измеряйте agreement judge-модели с людьми до автоматизации больших прогонов.

Типичные bias

Judge может предпочитать длинные ответы, собственный стиль, известную модель или уверенный тон. Проверяйте position bias, verbosity bias и self-preference.

Structured output для judge

Возвращайте score, reason, evidence и confidence по JSON Schema, чтобы eval pipeline мог валидировать результат и строить метрики.

Когда нужен human review

Низкий confidence, safety-sensitive кейсы, спорные pairwise решения и новые классы ошибок должны уходить человеку.

Regression gates

Сравнивайте новую версию с baseline на фиксированном наборе и блокируйте rollout при падении критичных метрик.

Как использовать несколько judges

Для важных задач можно применять несколько judge-моделей или повторные прогоны и анализировать disagreement вместо слепой веры в один score.

Production checklist

Версионируйте rubric и judge prompt, сохраняйте raw outputs, model/version, latency и cost, контролируйте drift и периодически перекалибровывайте на human labels.