Как это работает
Различают три режима. Pointwise: судья оценивает один ответ по рубрике (pass или fail). Pairwise: сравнивает два ответа и выбирает лучший, это удобно для A/B двух версий промпта. Reference-based: сверяет ответ с эталоном или найденным контекстом.
У судьи есть известные искажения: position bias (предпочитает ответ на определённой позиции), verbosity bias (завышает длинные ответы) и self-preference (симпатизирует ответам собственной модели). В исследовании авторов MT-Bench сильный судья совпадал с людскими предпочтениями более чем в 80% случаев, но искажения тоже описаны [1][2].
Пример
1{
2 "reasoning": "Ответ называет срок возврата 30 дней, а в контексте указано 14.",
3 "verdict": "fail"
4}Как применять в тестировании ИИ
Судья — ступень после детерминированных проверок (формат, схема, обязательные элементы). Его гоняют по golden dataset, считают pass rate по корзинам и ставят порог в CI. Сам судью нужно калибровать: сверьте его вердикты с человеческой разметкой на 30–50 кейсах.
Типичные ошибки
- Расплывчатый критерий вроде «оцени качество»: судья сам решает, что это, и результаты нельзя интерпретировать.
- Один судья на все критерии: непонятно, что именно сломалось. Делайте отдельного судью на каждый критерий.
- Судья из того же семейства, что и тестируемая модель, и никакой сверки с людьми.
Частые вопросы
Чем LLM-судья лучше ручной проверки?
Он быстрее, дешевле и масштабируется: сотни ответов проверяются за минуты после каждого изменения промпта. Ручная проверка остаётся эталоном для калибровки судьи и разбора спорных случаев.
Можно ли использовать ту же модель как тестируемую и как судью?
Лучше не стоит: модели склонны завышать оценки собственным ответам. По возможности берите судью из другого семейства или более сильную модель и сверяйте его с людьми.
Источники
- Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena — Zheng L., Chiang W.-L., Sheng Y. и др., NeurIPS 2023 (arXiv:2306.05685)
- LLM Evaluators Recognize and Favor Their Own Generations — Panickssery A., Bowman S. R., Feng S., arXiv:2404.13076, 2024