Глоссарий тестирования ИИ
Термины, которые нужны, чтобы тестировать приложения на LLM: от LLM-судьи и golden dataset до метрик RAG, параметров генерации и трассировки. У каждого термина определение, пример и типичные ошибки.
Основы оценки
Как автоматически оценивать ответы LLM: судья, наборы кейсов, evals.
LLM-as-a-Judge
LLM-as-a-Judge (LLM-судья) — подход к автоматической оценке, при котором ответ системы проверяет другая языковая модель по заданным критериям.
ЧитатьGolden dataset
Golden dataset (золотой набор) — коллекция проверочных кейсов с заранее известным ожидаемым поведением, на которой систему проверяют при каждом изменении.
ЧитатьLLM evals
LLM evals (evaluations) — систематическая автоматическая оценка качества ответов LLM-приложения на наборе кейсов с помощью метрик и LLM-судьи.
Читать
Метрики текста
BLEU, ROUGE, BERTScore, семантическая близость и другие метрики сходства.
BLEU
BLEU — метрика, которая оценивает текст по доле его n-грамм (последовательностей из 1–4 слов), совпавших с эталоном.
ЧитатьROUGE
ROUGE — семейство метрик, которые оценивают, какая доля эталонного текста нашлась в ответе модели.
ЧитатьBERTScore
BERTScore — метрика оценки текста, которая сравнивает не слова, а контекстные эмбеддинги токенов: для каждого токена ответа ищется самый похожий токен эталона и наоборот.
ЧитатьСемантическая близость
Семантическая близость — числовая оценка сходства смысла двух текстов.
ЧитатьExact Match и token F1
Exact Match (EM) — метрика, равная 1, если ответ после нормализации (регистр, пунктуация) совпал с эталоном, и 0 в остальных случаях.
Читать
RAG и поиск
Чанки, top-k, метрики поиска и генерации в RAG-системах.
RAG
RAG (Retrieval-Augmented Generation) — подход, при котором языковая модель отвечает не только по своим знаниям, но и по фрагментам, найденным во внешней базе документов.
ЧитатьЧанкинг
Чанкинг — разбиение документов на небольшие фрагменты (чанки), которые индексируют и находят при поиске в RAG.
ЧитатьTop-k в поиске (RAG)
Top-k в RAG — число самых релевантных фрагментов, которые поиск возвращает и подставляет в промпт.
ЧитатьHit rate@k
Hit rate@k — доля вопросов, для которых хотя бы один нужный чанк попал в первые k результатов поиска.
ЧитатьContext recall
Context recall — доля информации, необходимой для верного ответа, которая присутствует в найденных фрагментах.
ЧитатьMRR
MRR (Mean Reciprocal Rank, средний обратный ранг) — метрика поиска, равная среднему значению 1/позиция первого нужного результата в выдаче.
ЧитатьFaithfulness
Faithfulness (groundedness) — метрика, показывающая, какая доля утверждений в ответе подтверждается найденным контекстом.
ЧитатьAnswer relevance
Answer relevance — метрика, которая показывает, насколько ответ модели отвечает на заданный вопрос.
Читать
Безопасность и надёжность
Галлюцинации, prompt injection и другие риски LLM-приложений.
Галлюцинация LLM
Галлюцинация LLM — сгенерированный текст, который звучит убедительно, но не подтверждается источником или противоречит фактам.
ЧитатьPrompt injection
Prompt injection (промпт-инъекция) — атака, при которой текст в запросе пользователя или во внешних данных заставляет языковую модель нарушить исходные инструкции: раскрыть системный промпт, выполнить чужую команду или изменить поведение.
Читать
Параметры и скорость
Temperature, top-p, top-k, время до первого токена и кеширование промпта.
Temperature
Temperature (температура) — параметр генерации, который управляет случайностью выбора следующего токена.
ЧитатьTop-p (nucleus sampling)
Top-p (nucleus sampling) — способ семплирования, при котором следующий токен выбирают только из наименьшего набора самых вероятных токенов, суммарная вероятность которых не меньше p.
ЧитатьTop-k в семплировании
Top-k в семплировании — способ генерации, при котором следующий токен выбирают только из k самых вероятных вариантов, остальные отбрасываются.
ЧитатьTTFT (time to first token)
TTFT (time to first token) — время от отправки запроса до получения первого токена ответа модели при потоковой выдаче.
ЧитатьPrompt caching
Prompt caching (кеширование промпта) — механизм, при котором провайдер сохраняет уже обработанное начало промпта (системный промпт, описание инструментов, длинные документы) и при следующем запросе с тем же началом не обрабатывает его заново.
Читать
Форматы и инфраструктура
Структурированный вывод, трассировка запросов и протокол MCP.
Структурированный вывод (JSON Schema)
Структурированный вывод — ответ языковой модели в заранее заданной структуре, чаще всего JSON, соответствующий схеме (JSON Schema).
ЧитатьTrace id
Trace id — уникальный идентификатор, который проходит через все шаги обработки одного запроса: поиск, вызовы модели, инструменты.
ЧитатьMCP (Model Context Protocol)
MCP (Model Context Protocol) — открытый стандарт для подключения ИИ-приложений к внешним системам: источникам данных, инструментам и рабочим сценариям.
Читать
Что почитать дальше
Термины разобраны на практических примерах в статьях блога про тестирование LLM-приложений.
Тестирование ИИ: что и когда тестировать Инструменты оценки LLM