THREADQA
    THREADQA
    Главная
    Курсы
    Java QA AutomationNEW
    Новый курс · уже можно купить
    Python QA Automation
    Pytest, Playwright, Docker
    iOS QA Automation
    XCTest, XCUITest, Fastlane
    Все курсы
    Сравнить Java / Python / iOS
    Практика
    Мок собеседование
    Тренировка перед реальным интервью
    XPath Practice Hub
    Тренажёр XPath-запросов
    Roadmap
    Путь QA-инженера
    Тренажёры
    SQL, Git, Docker, Linux, тест-дизайн
    QA игры
    8 мини-игр для тестировщика
    XPath Dinner
    Практика XPath в игровом формате
    Каталог инструментов
    Инструменты тестирования и сравнения
    Глоссарий ИИ-тестирования
    LLM, RAG, метрики, evals
    С чего начать
    Блог
    FAQ
    Для компаний
    1. Домой
    2. Глоссарий тестирования ИИ
    3. LLM evals
    Основы оценки

    LLM evalsчто это и как применять в тестировании ИИ

    Также: evals, оценка LLM, LLM evaluation

    LLM evals (evaluations) — систематическая автоматическая оценка качества ответов LLM-приложения на наборе кейсов с помощью метрик и LLM-судьи. Это аналог тестового набора для недетерминированной системы: его запускают при изменении промпта, модели или базы знаний и сравнивают результаты с порогами.

    Автор: Олег Пендрак · Обновлено 19 сентября 2026 г.

    Как это работает

    Eval состоит из четырёх частей: набор кейсов (golden dataset), прогон тестируемой системы, оценщики (метрики, судья) и отчёт с порогами. Результат прогона имеет смысл только вместе с версиями промпта, модели, базы знаний и набора.

    Отличие от обычных тестов в том, что ожидаемого значения нет: проверяют свойства ответа (фактичность, релевантность, безопасность, формат) и смотрят на pass rate по группам кейсов.

    Пример

    Порог pass rate по корзине (pytest)
    1def test_bucket_pass_rate(results, bucket, threshold):
    2    rows = results[bucket]
    3    passed = sum(r["verdict"] == "pass" for r in rows)
    4    assert passed / len(rows) >= threshold, f"{bucket}: {passed}/{len(rows)}"

    Как применять в тестировании ИИ

    Быстрый smoke-набор запускают на каждый pull request, полный набор перед релизом, а при смене модели, промпта или базы знаний обязательно полную регрессию. В проде оценивают выборку реальных диалогов тем же судьёй.

    Типичные ошибки

    • Считать только итоговую цифру и не читать проваленные кейсы: именно в них видны реальные дефекты.
    • Менять несколько компонентов между прогонами: невозможно понять, что вызвало регрессию.
    • Не фиксировать версии модели и промпта в записи прогона.

    Частые вопросы

    Когда запускать LLM evals?

    Быстрый набор на каждый pull request, полный набор перед релизом, полную регрессию при смене модели, промпта или базы знаний и выборочную оценку в проде. Эти изменения меняют поведение бота при неизменном коде.

    Чем evals отличаются от обычных автотестов?

    В evals нет точного ожидаемого значения: проверяют свойства ответа и считают долю успешных кейсов. Вердикт выносят метрики и LLM-судья, а результат зависит от версий модели, промпта и базы знаний.

    На странице

    • Как это работает
    • Пример
    • В тестировании ИИ
    • Типичные ошибки
    • Частые вопросы

    Читайте в блоге

    • Тестирование ИИ: что и когда тестировать в LLM-приложении
    • LLM-as-a-Judge: как автоматически тестировать ответы LLM

    Связанные термины

    • Golden dataset
    • LLM-as-a-Judge
    • Галлюцинация LLM
    Все термины глоссария
    THREADQAПлатформа QA Automation

    О платформе

    Обучаем автоматизации тестирования на Java, Python и iOS. Практические курсы, roadmap, тренажёры и персональные мок-интервью.

    Онлайн 24/7

    Курсы

    • Java QA AutomationNEW
    • Python QA Automation
    • iOS QA Automation
    • Про ThreadQA

    Услуги

    • Мок-собеседования

    Инструменты

    • Roadmap QA
    • Тренажёры
    • QA игры
    • Тренажёр XPath
    • XPath Diner
    • Каталог инструментов
    • Глоссарий ИИ-тестирования

    Контакты

    • Email
      info@threadqa.ru
    • Telegram
      @penolegrus
    Публичная офертаПолитика конфиденциальностиУсловия использования
    © 2026·ThreadQA LMS·Все права защищены