Promptfoo
CLI и библиотека для оценки и red teaming LLM-приложений. YAML-конфиг, проверки ответов, сравнение моделей, CI/CD. MIT, часть OpenAI.
51 инструмент с фильтрами по категории, языку и сложности: от Playwright и REST Assured до оценки LLM.
Promptfoo или DeepEval, DeepEval или Ragas, LangSmith или Langfuse: факты сверены с документацией, а выводы «что выбрать» сформулированы по сценариям.
Отвечаем на популярные вопросы о выборе инструментов тестирования в 2026 году.
Для старта рекомендуем Playwright — он поддерживает Java, Python и TypeScript, имеет встроенное автоожидание и отличную документацию. Для API-тестирования начните с Postman: интуитивный интерфейс и не требует кода. Java-разработчикам стоит добавить JUnit 5 и REST Assured, Python-разработчикам — pytest.
Playwright — современный стандарт для новых проектов: встроенное автоожидание, трассировка, параллельный запуск, поддержка TypeScript/Python/Java из коробки. Selenium актуален для legacy-проектов и широкой кроссбраузерности. Для новых проектов рекомендуем Playwright.
Java: REST Assured (BDD-стиль, стандарт де-факто) + WireMock для мокирования. Python: requests + pytest или современный async-клиент HTTPX. Для ручного тестирования и CI/CD — Postman с Newman.
Appium — зрелый кроссплатформенный стандарт для iOS и Android, поддерживает Java, Python, TypeScript. Maestro — более новый инструмент с простым YAML-синтаксисом, быстрый старт. Для enterprise-проектов выбирайте Appium, для быстрого прототипирования — Maestro.
Выбор зависит от языка: JUnit 5 — стандарт для Java с мощными аннотациями и параметризацией; pytest — де-факто стандарт Python с минималистичным синтаксисом и богатой экосистемой плагинов; Vitest — для TypeScript/JavaScript проектов на Vite, в 10–20 раз быстрее Jest.
k6 от Grafana Labs — современный выбор для TypeScript с отличной CI/CD-интеграцией. Apache JMeter — проверенный инструмент с GUI для Java-команд. Gatling — высокопроизводительный инструмент для Java/Kotlin. Locust — популярный Python-инструмент с веб-интерфейсом и масштабированием.
1. Выберите язык (Java, Python или TypeScript). 2. Освойте базовый фреймворк (JUnit 5, pytest или Vitest). 3. Изучите инструмент UI-автоматизации (Playwright или Selenium). 4. Добавьте API-тестирование (REST Assured, requests или Supertest). 5. Настройте отчётность (Allure Report). На ThreadQA есть курсы по каждому из этих шагов.
Курсы ThreadQA по Selenium, REST Assured, Appium и другим инструментам — с реальными проектами и поддержкой ментора.
Найдено 7 из 51
CLI и библиотека для оценки и red teaming LLM-приложений. YAML-конфиг, проверки ответов, сравнение моделей, CI/CD. MIT, часть OpenAI.
Open-source фреймворк для unit-тестов LLM-приложений в стиле pytest. G-Eval, RAG-метрики, метрики агентов, LLM-as-a-judge. Apache 2.0.
Open-source библиотека оценки LLM-приложений: метрики RAG (faithfulness, context recall), агентов и текста, генерация тестовых наборов. Apache 2.0.
Платформа LangChain для трассировки, оценки и мониторинга LLM-приложений. Датасеты, эксперименты, LLM-as-a-judge. Облако, hybrid или self-hosted.
Open-source платформа для разработки LLM-приложений: трассировка, evals, управление промптами, датасеты. MIT, можно развернуть у себя.
Open-source платформа наблюдаемости и оценки ИИ-приложений на OpenTelemetry: трассировка, evals, эксперименты, playground. Лицензия ELv2.
Сканер уязвимостей LLM от NVIDIA: пробы на jailbreak, prompt injection, утечки данных, токсичность и галлюцинации. Apache 2.0.