THREADQA
    THREADQA
    Главная
    Курсы
    Java QA AutomationNEW
    Новый курс · уже можно купить
    Python QA Automation
    Pytest, Playwright, Docker
    iOS QA Automation
    XCTest, XCUITest, Fastlane
    Все курсы
    Сравнить Java / Python / iOS
    Практика
    Мок собеседование
    Тренировка перед реальным интервью
    XPath Practice Hub
    Тренажёр XPath-запросов
    Roadmap
    Путь QA-инженера
    Тренажёры
    SQL, Git, Docker, Linux, тест-дизайн
    QA игры
    8 мини-игр для тестировщика
    XPath Dinner
    Практика XPath в игровом формате
    Каталог инструментов
    Инструменты тестирования и сравнения
    Глоссарий ИИ-тестирования
    LLM, RAG, метрики, evals
    С чего начать
    Блог
    FAQ
    Для компаний
    1. Домой
    2. Глоссарий тестирования ИИ
    3. BERTScore
    Метрики текста

    BERTScoreчто это и как применять в тестировании ИИ

    Также: BERT Score

    BERTScore — метрика оценки текста, которая сравнивает не слова, а контекстные эмбеддинги токенов: для каждого токена ответа ищется самый похожий токен эталона и наоборот. Из этого получают precision, recall и F1 на уровне смысла. Метрика лучше BLEU справляется с перефразом, но слабо различает подмену чисел и отрицание.

    Автор: Олег Пендрак · Обновлено 19 сентября 2026 г.

    Как это работает

    Метод предложен на конференции ICLR 2020 и в исследовании показал лучшую корреляцию с человеческими оценками, чем метрики по совпадению слов [1]. Для русского языка достаточно указать язык в вызове библиотеки, для точности можно выбрать мультиязычную модель явно.

    Значения BERTScore трудно интерпретировать в абсолюте, поэтому их часто пересчитывают относительно базовой линии (baseline rescaling).

    Пример

    BERTScore в Python
    1from bert_score import score
    2
    3P, R, F1 = score(
    4    ["Товар можно вернуть в течение 14 дней после получения."],
    5    ["Вернуть товар можно в течение 14 дней с момента получения."],
    6    lang="ru",
    7)
    8print(F1.mean().item())

    Как применять в тестировании ИИ

    Используйте как метрику близости смысла для отсева явного брака. Добавляйте отдельные проверки на числа, даты и отрицания, потому что именно их BERTScore пропускает.

    Типичные ошибки

    • Считать высокий BERTScore признаком правильного факта: «30 дней» вместо «14 дней» остаётся «похожим».
    • Сравнивать значения разных моделей без пересчёта на базовую линию.
    • Не проверять метрику на «ловушках» с подменённым числом и отрицанием.

    Частые вопросы

    Что такое BERTScore и чем он лучше BLEU?

    BERTScore сравнивает контекстные эмбеддинги токенов, поэтому понимает перифраз и обычно ближе к человеческой оценке, чем BLEU. Но он слабо различает подмену числа и отрицание.

    Подходит ли BERTScore для русского языка?

    Да, библиотека поддерживает указание языка (lang="ru") и мультиязычные модели. Проверьте метрику на своих данных и ловушках, потому что качество зависит от модели эмбеддингов.

    Источники

    1. BERTScore: Evaluating Text Generation with BERT — Zhang T., Kishore V., Wu F., Weinberger K. Q., Artzi Y., ICLR 2020 (arXiv:1904.09675)

    На странице

    • Как это работает
    • Пример
    • В тестировании ИИ
    • Типичные ошибки
    • Частые вопросы
    • Источники

    Читайте в блоге

    • Метрики оценки ответов LLM: BLEU, ROUGE, BERTScore

    Связанные термины

    • Семантическая близость
    • BLEU
    • ROUGE
    Все термины глоссария
    THREADQAПлатформа QA Automation

    О платформе

    Обучаем автоматизации тестирования на Java, Python и iOS. Практические курсы, roadmap, тренажёры и персональные мок-интервью.

    Онлайн 24/7

    Курсы

    • Java QA AutomationNEW
    • Python QA Automation
    • iOS QA Automation
    • Про ThreadQA

    Услуги

    • Мок-собеседования

    Инструменты

    • Roadmap QA
    • Тренажёры
    • QA игры
    • Тренажёр XPath
    • XPath Diner
    • Каталог инструментов
    • Глоссарий ИИ-тестирования

    Контакты

    • Email
      info@threadqa.ru
    • Telegram
      @penolegrus
    Публичная офертаПолитика конфиденциальностиУсловия использования
    © 2026·ThreadQA LMS·Все права защищены