THREADQA
    THREADQA
    Главная
    Курсы
    Java QA AutomationNEW
    Новый курс · уже можно купить
    Python QA Automation
    Pytest, Playwright, Docker
    iOS QA Automation
    XCTest, XCUITest, Fastlane
    Все курсы
    Сравнить Java / Python / iOS
    Практика
    Мок собеседование
    Тренировка перед реальным интервью
    XPath Practice Hub
    Тренажёр XPath-запросов
    Roadmap
    Путь QA-инженера
    Тренажёры
    SQL, Git, Docker, Linux, тест-дизайн
    QA игры
    8 мини-игр для тестировщика
    XPath Dinner
    Практика XPath в игровом формате
    Каталог инструментов
    Инструменты тестирования и сравнения
    Глоссарий ИИ-тестирования
    LLM, RAG, метрики, evals
    С чего начать
    Блог
    FAQ
    Для компаний
    1. Домой
    2. Инструменты тестирования
    3. Сравнения
    4. Promptfoo vs DeepEval

    Promptfoo vs DeepEvalчто выбрать для тестирования LLM

    Promptfoo описывает evals декларативно в YAML и запускается как CLI, а DeepEval — это фреймворк в стиле pytest: тесты пишутся кодом и запускаются командой deepeval test run. Promptfoo удобнее для быстрого сравнения моделей и промптов и для red teaming, DeepEval — когда проверки LLM должны быть обычными тестами в Python-репозитории с готовыми метриками RAG и агентов.

    Автор: Олег Пендрак · Факты сверены с документацией 20 сентября 2026 г.

    Что выбрать

    Выбирайте Promptfoo, если:

    • Нужно быстро сравнить несколько моделей или версий промпта на одном наборе кейсов.
    • Команда предпочитает декларативную конфигурацию в YAML, а не тестовый код.
    • Нужны red teaming и проверка приложения на уязвимости в том же инструменте.
    • Проект на Node.js или вы не хотите привязывать evals к Python-репозиторию.

    Выбирайте DeepEval, если:

    • LLM-проверки должны жить в Python-проекте как обычные тесты и запускаться в CI.
    • Нужны готовые метрики RAG (Faithfulness, Contextual Recall и др.), агентов и многоходовых диалогов.
    • Нужен собственный критерий, описанный словами (G-Eval).
    • Команда уже пишет тесты на pytest и хочет тот же подход.

    Сравнение по критериям

    КритерийPromptfooDeepEval
    Что этоCLI и библиотека для evals и red teaming LLM-приложенийOpen-source фреймворк для unit-тестирования LLM-приложений, по духу похожий на pytest
    ЛицензияMITApache 2.0
    Как описываются тестыДекларативно: YAML-файл promptfooconfig.yaml (промпты, провайдеры, кейсы, проверки)Кодом: тестовые функции с assert_test и объектами LLMTestCase
    Установкаnpm install -g promptfoo, brew install promptfoo, pip install promptfoo или запуск через npx promptfoo@latestpip install -U deepeval (Python) и npm install --save-dev deepeval (TypeScript)
    Запускpromptfoo eval и promptfoo view для просмотра результатовdeepeval test run test_file.py
    Проверки ответовДетерминированные (equals, contains, regex, is-json, latency, cost и др.) и модельные (llm-rubric, g-eval, factuality, context-faithfulness, context-recall и др.)Метрики: G-Eval и DAG, RAG (Answer Relevancy, Faithfulness, Contextual Recall, Contextual Precision, Contextual Relevancy), агентные, многоходовые, а также Hallucination, Summarization, Bias, Toxicity, JSON Correctness
    Модель-судьяПровайдеры задаются в конфиге (OpenAI, Anthropic, Azure, Bedrock, Ollama и другие), модели можно сравнивать рядомПо умолчанию OpenAI (нужен OPENAI_API_KEY), можно подключить собственную модель
    Безопасность и red teamingВстроены red teaming, сканирование уязвимостей и проверка pull request на риски LLMВ проверенном README отдельным разделом не выделены; есть метрики Bias и Toxicity
    Где выполняетсяЛокально: по README промпты не покидают вашу машину (запросы к моделям идут провайдерам)По README метрики выполняются локально; в качестве судьи по умолчанию вызывается OpenAI
    ПлатформаПроект стал частью OpenAI и остаётся open source под MITConfident AI — отдельная необязательная платформа для отчётов и мониторинга

    Если в ячейке написано «в проверенном README не описано», это значит, что в изученных материалах такой информации нет, а не что возможности у инструмента нет. Проверьте актуальную документацию.

    Как использовать вместе

    Практический совет: Promptfoo подходит для быстрых сравнений моделей и промптов и для red teaming, а DeepEval — для регрессионных тестов LLM внутри Python-проекта. Это не взаимоисключающие инструменты: у них разные точки входа в один и тот же процесс оценки.

    Частые вопросы

    Что лучше для новичка: Promptfoo или DeepEval?

    Promptfoo проще начать без кода: достаточно YAML-конфига и трёх команд (init, eval, view). DeepEval лучше подойдёт, если вы уже пишете тесты на pytest и хотите тот же подход для LLM.

    Можно ли использовать Promptfoo и DeepEval вместе?

    Да. Promptfoo можно применять для сравнения моделей, промптов и red teaming, а DeepEval для тестов внутри Python-проекта. Главное — единый golden dataset и согласованные критерии оценки.

    У какого инструмента больше готовых метрик?

    В README DeepEval перечислены десятки метрик: RAG, агентные, многоходовые, Hallucination, Bias, Toxicity и другие. В Promptfoo проверки называются assertions: детерминированные и модельные типы, включая context-faithfulness и context-recall. Выбирать стоит по тому, какие из них вам нужны.

    Источники

    • Promptfoo: README на GitHub
    • Promptfoo: Getting Started
    • Promptfoo: типы проверок (assertions)
    • DeepEval: README на GitHub
    • DeepEval: Getting Started

    Другие сравнения

    • DeepEval vs Ragas
    • LangSmith vs Langfuse
    • Langfuse vs Arize Phoenix
    • Promptfoo vs garak
    Начни бесплатно

    Изучай инструменты на практике

    Курсы ThreadQA по Selenium, REST Assured, Appium и другим инструментам — с реальными проектами и поддержкой ментора.

    Практика на реальных проектахПоддержка ментораСертификат по окончании
    Начать обучение бесплатно
    Смотреть курсы·Мок-собеседование
    ✓ Доступ навсегда✓ Оплата через СБП✓ Олег отвечает лично✓ Оплата частями от партнёров СБП
    Возврат — по условиям оферты
    THREADQAПлатформа QA Automation

    О платформе

    Обучаем автоматизации тестирования на Java, Python и iOS. Практические курсы, roadmap, тренажёры и персональные мок-интервью.

    Онлайн 24/7

    Курсы

    • Java QA AutomationNEW
    • Python QA Automation
    • iOS QA Automation
    • Про ThreadQA

    Услуги

    • Мок-собеседования

    Инструменты

    • Roadmap QA
    • Тренажёры
    • QA игры
    • Тренажёр XPath
    • XPath Diner
    • Каталог инструментов
    • Глоссарий ИИ-тестирования

    Контакты

    • Email
      info@threadqa.ru
    • Telegram
      @penolegrus
    Публичная офертаПолитика конфиденциальностиУсловия использования
    © 2026·ThreadQA LMS·Все права защищены