Как это работает
Метрика предложена среди базовых для оценки RAG без ручной разметки эталонных ответов [1]. Она оценивает только генерацию: верен ли ответ относительно того, что принёс поиск, а не верен ли он вообще.
Поэтому высокая faithfulness при неверном ответе часто означает проблему поиска: модель честно пересказала неполный или неверный контекст.
faithfulness = (утверждения ответа, подтверждённые контекстом) / (все утверждения ответа)
Пример
Контекст: «Возврат в течение 14 дней. Возврат денег — на карту.» Ответ: «Вернуть можно за 14 дней, деньги придут на карту, доставка бесплатная.» Утверждений: 3, подтверждено: 2 → faithfulness = 2/3 ≈ 0,67
Как применять в тестировании ИИ
Считайте faithfulness судьёй по корзинам golden dataset и ставьте порог. Для диагностики подставляйте в промпт идеальный контекст: если и тогда faithfulness низкая, проблема в промпте, температуре или модели.
Типичные ошибки
- Путать faithfulness с корректностью: ответ может быть верно пересказом неверного контекста.
- Считать метрику одним вызовом судьи без разбивки на утверждения.
- Не проверять судью, который оценивает faithfulness, на людях.
Частые вопросы
Что такое faithfulness в RAG?
Это доля утверждений в ответе, которые подтверждаются найденным контекстом. Низкое значение означает, что модель выдумывает факты поверх контекста.
Чем faithfulness отличается от answer relevance?
Faithfulness проверяет, что ответ опирается на контекст, а answer relevance — что он отвечает на заданный вопрос. Ответ может быть точным пересказом контекста, но мимо вопроса.
Источники
- Ragas: Automated Evaluation of Retrieval Augmented Generation — Es S., James J., Espinosa-Anke L., Schockaert S., arXiv:2309.15217, 2023