THREADQA
    THREADQA
    Главная
    Курсы
    Java QA AutomationNEW
    Новый курс · уже можно купить
    Python QA Automation
    Pytest, Playwright, Docker
    iOS QA Automation
    XCTest, XCUITest, Fastlane
    Все курсы
    Сравнить Java / Python / iOS
    Практика
    Мок собеседование
    Тренировка перед реальным интервью
    XPath Practice Hub
    Тренажёр XPath-запросов
    Roadmap
    Путь QA-инженера
    Тренажёры
    SQL, Git, Docker, Linux, тест-дизайн
    QA игры
    8 мини-игр для тестировщика
    XPath Dinner
    Практика XPath в игровом формате
    Каталог инструментов
    Инструменты тестирования и сравнения
    Глоссарий ИИ-тестирования
    LLM, RAG, метрики, evals
    С чего начать
    Блог
    FAQ
    Для компаний
    1. Домой
    2. Глоссарий тестирования ИИ
    3. BLEU
    Метрики текста

    BLEUчто это и как применять в тестировании ИИ

    Также: BLEU score, Bilingual Evaluation Understudy

    BLEU — метрика, которая оценивает текст по доле его n-грамм (последовательностей из 1–4 слов), совпавших с эталоном. Это метрика precision со штрафом за краткость. Её создали для оценки машинного перевода, для свободных ответов чат-ботов она подходит плохо: перефраз получает низкий балл, а подмена факта почти не влияет.

    Автор: Олег Пендрак · Обновлено 19 сентября 2026 г.

    Как это работает

    Метрика была предложена для машинного перевода в 2002 году [1]. Значение лежит от 0 до 1 (иногда его пишут в процентах). Без сглаживания оценка обнуляется, если нет ни одной общей 4-граммы, поэтому на коротких текстах нужно сглаживание (smoothing).

    Значение зависит от токенизации, сглаживания и числа эталонов, поэтому сравнивать цифры из разных источников нельзя, а замеры нужно делать одним и тем же кодом.

    Формула
    BLEU = BP × exp( (1/N) × Σ log p_n ),  n = 1…N
    BP — штраф за краткость, p_n — точность по n-граммам

    Пример

    BLEU в Python (nltk)
    1import re
    2from nltk.translate.bleu_score import SmoothingFunction, sentence_bleu
    3
    4def tokenize(text):
    5    return re.findall(r"\w+", text.lower())   # учитывает кириллицу
    6
    7reference = "Вернуть товар можно в течение 14 дней."
    8candidate = "Товар можно вернуть в течение 14 дней."
    9score = sentence_bleu(
    10    [tokenize(reference)], tokenize(candidate),
    11    smoothing_function=SmoothingFunction().method1,
    12)

    Как применять в тестировании ИИ

    Применяйте BLEU там, где формулировка должна быть близка к эталону: перевод, строго ограниченные форматы. Для чат-ботов и RAG используйте метрики смысла и LLM-судью.

    Типичные ошибки

    • Использовать BLEU для свободных ответов: он ставит низкий балл верному перифразу.
    • Считать, что высокий BLEU означает верный факт: замена «14 дней» на «30 дней» почти не меняет оценку.
    • Сравнивать значения из разных статей и библиотек без учёта токенизации.

    Частые вопросы

    Чем BLEU отличается от ROUGE?

    BLEU измеряет precision (какая доля слов ответа есть в эталоне), а ROUGE — recall (какая доля эталона нашлась в ответе). BLEU создавали для перевода, ROUGE для суммаризации. Обе не понимают смысл.

    Подходит ли BLEU для оценки чат-ботов?

    Как правило, нет: у чат-бота много правильных формулировок, и точный перифраз получает низкий балл. Лучше использовать метрики смысла, LLM-судью и проверки фактичности.

    Источники

    1. Bleu: a Method for Automatic Evaluation of Machine Translation — Papineni K., Roukos S., Ward T., Zhu W.-J., ACL 2002

    На странице

    • Как это работает
    • Пример
    • В тестировании ИИ
    • Типичные ошибки
    • Частые вопросы
    • Источники

    Читайте в блоге

    • Метрики оценки ответов LLM: BLEU, ROUGE, BERTScore

    Связанные термины

    • ROUGE
    • BERTScore
    • Семантическая близость
    • Exact Match и token F1
    Все термины глоссария
    THREADQAПлатформа QA Automation

    О платформе

    Обучаем автоматизации тестирования на Java, Python и iOS. Практические курсы, roadmap, тренажёры и персональные мок-интервью.

    Онлайн 24/7

    Курсы

    • Java QA AutomationNEW
    • Python QA Automation
    • iOS QA Automation
    • Про ThreadQA

    Услуги

    • Мок-собеседования

    Инструменты

    • Roadmap QA
    • Тренажёры
    • QA игры
    • Тренажёр XPath
    • XPath Diner
    • Каталог инструментов
    • Глоссарий ИИ-тестирования

    Контакты

    • Email
      info@threadqa.ru
    • Telegram
      @penolegrus
    Публичная офертаПолитика конфиденциальностиУсловия использования
    © 2026·ThreadQA LMS·Все права защищены