THREADQA
    THREADQA
    Главная
    Курсы
    Java QA AutomationNEW
    Новый курс · уже можно купить
    Python QA Automation
    Pytest, Playwright, Docker
    iOS QA Automation
    XCTest, XCUITest, Fastlane
    Все курсы
    Сравнить Java / Python / iOS
    Практика
    Мок собеседование
    Тренировка перед реальным интервью
    XPath Practice Hub
    Тренажёр XPath-запросов
    Roadmap
    Путь QA-инженера
    Тренажёры
    SQL, Git, Docker, Linux, тест-дизайн
    QA игры
    8 мини-игр для тестировщика
    XPath Dinner
    Практика XPath в игровом формате
    Каталог инструментов
    Инструменты тестирования и сравнения
    Глоссарий ИИ-тестирования
    LLM, RAG, метрики, evals
    С чего начать
    Блог
    FAQ
    Для компаний
    1. Домой
    2. Глоссарий тестирования ИИ
    3. LLM-as-a-Judge
    Основы оценки

    LLM-as-a-Judgeчто это и как применять в тестировании ИИ

    Также: LLM-судья, LLM as a judge, оценщик на основе LLM

    LLM-as-a-Judge (LLM-судья) — подход к автоматической оценке, при котором ответ системы проверяет другая языковая модель по заданным критериям. Судья получает вопрос, ответ и рубрику, а возвращает вердикт с объяснением. Его используют там, где точное сравнение с эталоном невозможно: чат-боты, RAG, суммаризация.

    Автор: Олег Пендрак · Обновлено 19 сентября 2026 г.

    Как это работает

    Различают три режима. Pointwise: судья оценивает один ответ по рубрике (pass или fail). Pairwise: сравнивает два ответа и выбирает лучший, это удобно для A/B двух версий промпта. Reference-based: сверяет ответ с эталоном или найденным контекстом.

    У судьи есть известные искажения: position bias (предпочитает ответ на определённой позиции), verbosity bias (завышает длинные ответы) и self-preference (симпатизирует ответам собственной модели). В исследовании авторов MT-Bench сильный судья совпадал с людскими предпочтениями более чем в 80% случаев, но искажения тоже описаны [1][2].

    Пример

    Вердикт судьи в формате JSON
    1{
    2  "reasoning": "Ответ называет срок возврата 30 дней, а в контексте указано 14.",
    3  "verdict": "fail"
    4}

    Как применять в тестировании ИИ

    Судья — ступень после детерминированных проверок (формат, схема, обязательные элементы). Его гоняют по golden dataset, считают pass rate по корзинам и ставят порог в CI. Сам судью нужно калибровать: сверьте его вердикты с человеческой разметкой на 30–50 кейсах.

    Типичные ошибки

    • Расплывчатый критерий вроде «оцени качество»: судья сам решает, что это, и результаты нельзя интерпретировать.
    • Один судья на все критерии: непонятно, что именно сломалось. Делайте отдельного судью на каждый критерий.
    • Судья из того же семейства, что и тестируемая модель, и никакой сверки с людьми.

    Частые вопросы

    Чем LLM-судья лучше ручной проверки?

    Он быстрее, дешевле и масштабируется: сотни ответов проверяются за минуты после каждого изменения промпта. Ручная проверка остаётся эталоном для калибровки судьи и разбора спорных случаев.

    Можно ли использовать ту же модель как тестируемую и как судью?

    Лучше не стоит: модели склонны завышать оценки собственным ответам. По возможности берите судью из другого семейства или более сильную модель и сверяйте его с людьми.

    Источники

    1. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena — Zheng L., Chiang W.-L., Sheng Y. и др., NeurIPS 2023 (arXiv:2306.05685)
    2. LLM Evaluators Recognize and Favor Their Own Generations — Panickssery A., Bowman S. R., Feng S., arXiv:2404.13076, 2024

    На странице

    • Как это работает
    • Пример
    • В тестировании ИИ
    • Типичные ошибки
    • Частые вопросы
    • Источники

    Читайте в блоге

    • LLM-as-a-Judge: как автоматически тестировать ответы LLM
    • Как тестировать LLM-чатбота: кейсы, диалоги и golden set

    Связанные термины

    • Golden dataset
    • LLM evals
    • Faithfulness
    • Галлюцинация LLM
    Все термины глоссария
    THREADQAПлатформа QA Automation

    О платформе

    Обучаем автоматизации тестирования на Java, Python и iOS. Практические курсы, roadmap, тренажёры и персональные мок-интервью.

    Онлайн 24/7

    Курсы

    • Java QA AutomationNEW
    • Python QA Automation
    • iOS QA Automation
    • Про ThreadQA

    Услуги

    • Мок-собеседования

    Инструменты

    • Roadmap QA
    • Тренажёры
    • QA игры
    • Тренажёр XPath
    • XPath Diner
    • Каталог инструментов
    • Глоссарий ИИ-тестирования

    Контакты

    • Email
      info@threadqa.ru
    • Telegram
      @penolegrus
    Публичная офертаПолитика конфиденциальностиУсловия использования
    © 2026·ThreadQA LMS·Все права защищены