THREADQA
    THREADQA
    Главная
    Курсы
    Java QA AutomationNEW
    Новый курс · уже можно купить
    Python QA Automation
    Pytest, Playwright, Docker
    iOS QA Automation
    XCTest, XCUITest, Fastlane
    Все курсы
    Сравнить Java / Python / iOS
    Практика
    Мок собеседование
    Тренировка перед реальным интервью
    XPath Practice Hub
    Тренажёр XPath-запросов
    Roadmap
    Путь QA-инженера
    Тренажёры
    SQL, Git, Docker, Linux, тест-дизайн
    QA игры
    8 мини-игр для тестировщика
    XPath Dinner
    Практика XPath в игровом формате
    Каталог инструментов
    Инструменты тестирования и сравнения
    Глоссарий ИИ-тестирования
    LLM, RAG, метрики, evals
    С чего начать
    Блог
    FAQ
    Для компаний
    1. Домой
    2. Глоссарий тестирования ИИ

    Глоссарий тестирования ИИ

    Термины, которые нужны, чтобы тестировать приложения на LLM: от LLM-судьи и golden dataset до метрик RAG, параметров генерации и трассировки. У каждого термина определение, пример и типичные ошибки.

    Основы оценки3Метрики текста5RAG и поиск8Безопасность и надёжность2Параметры и скорость5Форматы и инфраструктура3

    Основы оценки

    Как автоматически оценивать ответы LLM: судья, наборы кейсов, evals.

    • LLM-as-a-Judge

      LLM-as-a-Judge (LLM-судья) — подход к автоматической оценке, при котором ответ системы проверяет другая языковая модель по заданным критериям.

      Читать
    • Golden dataset

      Golden dataset (золотой набор) — коллекция проверочных кейсов с заранее известным ожидаемым поведением, на которой систему проверяют при каждом изменении.

      Читать
    • LLM evals

      LLM evals (evaluations) — систематическая автоматическая оценка качества ответов LLM-приложения на наборе кейсов с помощью метрик и LLM-судьи.

      Читать

    Метрики текста

    BLEU, ROUGE, BERTScore, семантическая близость и другие метрики сходства.

    • BLEU

      BLEU — метрика, которая оценивает текст по доле его n-грамм (последовательностей из 1–4 слов), совпавших с эталоном.

      Читать
    • ROUGE

      ROUGE — семейство метрик, которые оценивают, какая доля эталонного текста нашлась в ответе модели.

      Читать
    • BERTScore

      BERTScore — метрика оценки текста, которая сравнивает не слова, а контекстные эмбеддинги токенов: для каждого токена ответа ищется самый похожий токен эталона и наоборот.

      Читать
    • Семантическая близость

      Семантическая близость — числовая оценка сходства смысла двух текстов.

      Читать
    • Exact Match и token F1

      Exact Match (EM) — метрика, равная 1, если ответ после нормализации (регистр, пунктуация) совпал с эталоном, и 0 в остальных случаях.

      Читать

    RAG и поиск

    Чанки, top-k, метрики поиска и генерации в RAG-системах.

    • RAG

      RAG (Retrieval-Augmented Generation) — подход, при котором языковая модель отвечает не только по своим знаниям, но и по фрагментам, найденным во внешней базе документов.

      Читать
    • Чанкинг

      Чанкинг — разбиение документов на небольшие фрагменты (чанки), которые индексируют и находят при поиске в RAG.

      Читать
    • Top-k в поиске (RAG)

      Top-k в RAG — число самых релевантных фрагментов, которые поиск возвращает и подставляет в промпт.

      Читать
    • Hit rate@k

      Hit rate@k — доля вопросов, для которых хотя бы один нужный чанк попал в первые k результатов поиска.

      Читать
    • Context recall

      Context recall — доля информации, необходимой для верного ответа, которая присутствует в найденных фрагментах.

      Читать
    • MRR

      MRR (Mean Reciprocal Rank, средний обратный ранг) — метрика поиска, равная среднему значению 1/позиция первого нужного результата в выдаче.

      Читать
    • Faithfulness

      Faithfulness (groundedness) — метрика, показывающая, какая доля утверждений в ответе подтверждается найденным контекстом.

      Читать
    • Answer relevance

      Answer relevance — метрика, которая показывает, насколько ответ модели отвечает на заданный вопрос.

      Читать

    Безопасность и надёжность

    Галлюцинации, prompt injection и другие риски LLM-приложений.

    • Галлюцинация LLM

      Галлюцинация LLM — сгенерированный текст, который звучит убедительно, но не подтверждается источником или противоречит фактам.

      Читать
    • Prompt injection

      Prompt injection (промпт-инъекция) — атака, при которой текст в запросе пользователя или во внешних данных заставляет языковую модель нарушить исходные инструкции: раскрыть системный промпт, выполнить чужую команду или изменить поведение.

      Читать

    Параметры и скорость

    Temperature, top-p, top-k, время до первого токена и кеширование промпта.

    • Temperature

      Temperature (температура) — параметр генерации, который управляет случайностью выбора следующего токена.

      Читать
    • Top-p (nucleus sampling)

      Top-p (nucleus sampling) — способ семплирования, при котором следующий токен выбирают только из наименьшего набора самых вероятных токенов, суммарная вероятность которых не меньше p.

      Читать
    • Top-k в семплировании

      Top-k в семплировании — способ генерации, при котором следующий токен выбирают только из k самых вероятных вариантов, остальные отбрасываются.

      Читать
    • TTFT (time to first token)

      TTFT (time to first token) — время от отправки запроса до получения первого токена ответа модели при потоковой выдаче.

      Читать
    • Prompt caching

      Prompt caching (кеширование промпта) — механизм, при котором провайдер сохраняет уже обработанное начало промпта (системный промпт, описание инструментов, длинные документы) и при следующем запросе с тем же началом не обрабатывает его заново.

      Читать

    Форматы и инфраструктура

    Структурированный вывод, трассировка запросов и протокол MCP.

    • Структурированный вывод (JSON Schema)

      Структурированный вывод — ответ языковой модели в заранее заданной структуре, чаще всего JSON, соответствующий схеме (JSON Schema).

      Читать
    • Trace id

      Trace id — уникальный идентификатор, который проходит через все шаги обработки одного запроса: поиск, вызовы модели, инструменты.

      Читать
    • MCP (Model Context Protocol)

      MCP (Model Context Protocol) — открытый стандарт для подключения ИИ-приложений к внешним системам: источникам данных, инструментам и рабочим сценариям.

      Читать

    Что почитать дальше

    Термины разобраны на практических примерах в статьях блога про тестирование LLM-приложений.

    Тестирование ИИ: что и когда тестировать Инструменты оценки LLM
    THREADQAПлатформа QA Automation

    О платформе

    Обучаем автоматизации тестирования на Java, Python и iOS. Практические курсы, roadmap, тренажёры и персональные мок-интервью.

    Онлайн 24/7

    Курсы

    • Java QA AutomationNEW
    • Python QA Automation
    • iOS QA Automation
    • Про ThreadQA

    Услуги

    • Мок-собеседования

    Инструменты

    • Roadmap QA
    • Тренажёры
    • QA игры
    • Тренажёр XPath
    • XPath Diner
    • Каталог инструментов
    • Глоссарий ИИ-тестирования

    Контакты

    • Email
      info@threadqa.ru
    • Telegram
      @penolegrus
    Публичная офертаПолитика конфиденциальностиУсловия использования
    © 2026·ThreadQA LMS·Все права защищены