Как это работает
Метрика ловит ответы «по теме, но мимо вопроса»: бот рассказал про доставку, когда спрашивали про возврат. Причина бывает в поиске, который принёс соседнюю тему, или в промпте, который нечётко формулирует задачу.
В фреймворке RAGAS релевантность оценивают, в частности, по тому, насколько ответ соответствует вопросу, без ручной разметки эталонов [1]. На практике удобно начать с рубрики для судьи: «ответ прямо отвечает на вопрос, не уходит в сторону».
Пример
PASS — ответ прямо отвечает на заданный вопрос. FAIL — ответ по теме, но не содержит того, о чём спросили, или уходит в сторону.
Как применять в тестировании ИИ
Проверяйте вместе с faithfulness: низкая релевантность при высокой faithfulness подсказывает проблему в промпте или в качестве найденных фрагментов (context precision), а не в выдумках модели.
Типичные ошибки
- Считать высокую faithfulness достаточной: ответ может быть точным, но не про то.
- Оценивать релевантность без учёта корзин: для вопросов вне области правильный ответ — отказ.
- Не читать проваленные кейсы: там видно, поиск виноват или формулировка промпта.
Частые вопросы
Что такое answer relevance?
Это оценка того, насколько ответ отвечает на заданный вопрос. Она ловит ответы, которые точны и опираются на контекст, но не отвечают на то, о чём спросил пользователь.
Как измерить релевантность ответа?
Чаще всего LLM-судьёй по рубрике pass/fail: «ответ прямо отвечает на вопрос». Метрику считают по корзинам golden dataset и разбирают проваленные кейсы.
Источники
- Ragas: Automated Evaluation of Retrieval Augmented Generation — Es S., James J., Espinosa-Anke L., Schockaert S., arXiv:2309.15217, 2023