THREADQA
    THREADQA
    Главная
    Курсы
    Java QA AutomationNEW
    Новый курс · уже можно купить
    Python QA Automation
    Pytest, Playwright, Docker
    iOS QA Automation
    XCTest, XCUITest, Fastlane
    Все курсы
    Сравнить Java / Python / iOS
    Практика
    Мок собеседование
    Тренировка перед реальным интервью
    XPath Practice Hub
    Тренажёр XPath-запросов
    Roadmap
    Путь QA-инженера
    Тренажёры
    SQL, Git, Docker, Linux, тест-дизайн
    QA игры
    8 мини-игр для тестировщика
    XPath Dinner
    Практика XPath в игровом формате
    Каталог инструментов
    Инструменты тестирования и сравнения
    Глоссарий ИИ-тестирования
    LLM, RAG, метрики, evals
    С чего начать
    Блог
    FAQ
    Для компаний
    1. Домой
    2. Инструменты тестирования
    3. Сравнения
    4. DeepEval vs Ragas

    DeepEval vs Ragasчто выбрать для тестирования LLM

    DeepEval — фреймворк, где проверки LLM оформляются как тесты и запускаются командой deepeval test run. Ragas — библиотека метрик и экспериментов с упором на оценку RAG, генерацию тестовых данных и интеграции с LangChain и LlamaIndex. Если нужны тесты с assert и CI, подойдёт DeepEval, а если нужен богатый набор метрик, эксперименты и синтетические тестовые данные, стоит смотреть на Ragas.

    Автор: Олег Пендрак · Факты сверены с документацией 20 сентября 2026 г.

    Что выбрать

    Выбирайте DeepEval, если:

    • Нужны тесты в стиле pytest с assert_test и запуском через CLI в CI.
    • Нужны метрики для агентов, многоходовых диалогов, Hallucination, Bias, Toxicity и JSON Correctness.
    • Хочется описывать критерий словами через G-Eval.

    Выбирайте Ragas, если:

    • Нужен широкий набор метрик RAG (Context Entities Recall, Noise Sensitivity и др.) и классических метрик текста (BLEU, ROUGE, Exact Match).
    • Нет готового тестового набора и нужна генерация тестовых данных.
    • Вы строите эксперименты и собственные метрики через декораторы и работаете с LangChain или LlamaIndex.

    Сравнение по критериям

    КритерийDeepEvalRagas
    Что этоФреймворк для unit-тестирования LLM-приложений в стиле pytestБиблиотека для оценки LLM-приложений: метрики, эксперименты, датасеты
    ЛицензияApache 2.0Apache-2.0
    Установкаpip install -U deepevalpip install ragas
    ЗапускТесты с assert_test запускаются командой deepeval test runМетрики вызываются из кода (в примере README асинхронно через ascore); документация делает упор на эксперименты
    Метрики RAGAnswer Relevancy, Faithfulness, Contextual Recall, Contextual Precision, Contextual Relevancy (и метрика RAGAS)Context Precision, Context Recall, Context Entities Recall, Noise Sensitivity, Response Relevancy, Faithfulness
    Метрики агентовTask Completion, Tool Correctness, Goal Accuracy, Step Efficiency, Plan Adherence и другиеTopic Adherence, Tool Call Accuracy, Tool Call F1, Agent Goal Accuracy
    Классические метрики текстаВ проверенном README не перечисленыFactual Correctness, Semantic Similarity, BLEU, CHRF, ROUGE, Exact Match, String Presence
    Универсальные метрикиG-Eval и DAG (свой критерий словами или графом решений)Aspect Critic, Simple Criteria Scoring, оценка по рубрикам
    Генерация тестовых данныхВ проверенных материалах не указанаЕсть: README упоминает генерацию тестовых наборов, близких к продакшену
    Интеграции и платформаПлатформа Confident AI для отчётов и мониторинга (необязательна)LangChain, LlamaIndex и подобные фреймворки, инструменты наблюдаемости

    Если в ячейке написано «в проверенном README не описано», это значит, что в изученных материалах такой информации нет, а не что возможности у инструмента нет. Проверьте актуальную документацию.

    Как использовать вместе

    Практический совет: в DeepEval RAGAS-метрики доступны как отдельная группа, поэтому их можно запускать в тестах DeepEval. Для генерации тестовых данных и специфических метрик RAG можно брать Ragas, а тест-раннер и CI оставить на DeepEval.

    Частые вопросы

    Чем Ragas отличается от DeepEval?

    DeepEval — фреймворк тестов в стиле pytest с запуском deepeval test run. Ragas — библиотека метрик и экспериментов с упором на RAG и генерацию тестовых данных. У DeepEval есть собственные RAG-метрики, а метрики RAGAS доступны в нём как отдельная группа.

    Какой инструмент лучше для оценки RAG?

    Оба поддерживают Faithfulness, Context Precision и Context Recall. Ragas добавляет Context Entities Recall и Noise Sensitivity, а DeepEval — Contextual Relevancy и Answer Relevancy. Выбирайте по тому, нужны ли вам тесты с assert и CI (DeepEval) или эксперименты и генерация тестовых данных (Ragas).

    Можно ли использовать Ragas вместе с DeepEval?

    Да. Метрики RAGAS можно запускать внутри DeepEval, а тестовые данные при необходимости генерировать в Ragas. Главное — сверить метрики с человеческой оценкой на небольшом наборе.

    Источники

    • DeepEval: README на GitHub
    • DeepEval: Getting Started
    • Ragas: README на GitHub
    • Ragas: список метрик

    Другие сравнения

    • Promptfoo vs DeepEval
    • LangSmith vs Langfuse
    • Langfuse vs Arize Phoenix
    • Promptfoo vs garak
    Начни бесплатно

    Изучай инструменты на практике

    Курсы ThreadQA по Selenium, REST Assured, Appium и другим инструментам — с реальными проектами и поддержкой ментора.

    Практика на реальных проектахПоддержка ментораСертификат по окончании
    Начать обучение бесплатно
    Смотреть курсы·Мок-собеседование
    ✓ Доступ навсегда✓ Оплата через СБП✓ Олег отвечает лично✓ Оплата частями от партнёров СБП
    Возврат — по условиям оферты
    THREADQAПлатформа QA Automation

    О платформе

    Обучаем автоматизации тестирования на Java, Python и iOS. Практические курсы, roadmap, тренажёры и персональные мок-интервью.

    Онлайн 24/7

    Курсы

    • Java QA AutomationNEW
    • Python QA Automation
    • iOS QA Automation
    • Про ThreadQA

    Услуги

    • Мок-собеседования

    Инструменты

    • Roadmap QA
    • Тренажёры
    • QA игры
    • Тренажёр XPath
    • XPath Diner
    • Каталог инструментов
    • Глоссарий ИИ-тестирования

    Контакты

    • Email
      info@threadqa.ru
    • Telegram
      @penolegrus
    Публичная офертаПолитика конфиденциальностиУсловия использования
    © 2026·ThreadQA LMS·Все права защищены