THREADQA
    THREADQA
    Главная
    Курсы
    Java QA AutomationNEW
    Новый курс · уже можно купить
    Python QA Automation
    Pytest, Playwright, Docker
    iOS QA Automation
    XCTest, XCUITest, Fastlane
    Все курсы
    Сравнить Java / Python / iOS
    Практика
    Мок собеседование
    Тренировка перед реальным интервью
    XPath Practice Hub
    Тренажёр XPath-запросов
    Roadmap
    Путь QA-инженера
    Тренажёры
    SQL, Git, Docker, Linux, тест-дизайн
    QA игры
    8 мини-игр для тестировщика
    XPath Dinner
    Практика XPath в игровом формате
    Каталог инструментов
    Инструменты тестирования и сравнения
    Глоссарий ИИ-тестирования
    LLM, RAG, метрики, evals
    С чего начать
    Блог
    FAQ
    Для компаний
    1. Домой
    2. Глоссарий тестирования ИИ
    3. TTFT (time to first token)
    Параметры и скорость

    TTFT (time to first token)что это и как применять в тестировании ИИ

    Также: time to first token, время до первого токена

    TTFT (time to first token) — время от отправки запроса до получения первого токена ответа модели при потоковой выдаче. Метрика определяет, как быстро пользователь увидит, что ответ пошёл, и потому сильно влияет на воспринимаемую скорость чат-бота. В отличие от полного времени ответа, она не зависит от длины генерируемого текста.

    Автор: Олег Пендрак · Обновлено 19 сентября 2026 г.

    Как это работает

    На TTFT влияют сеть, очередь на стороне провайдера, длина промпта (чем длиннее контекст, тем дольше его обработка перед первым токеном) и загрузка модели. Кеширование неизменной части промпта может сокращать обработку и, соответственно, TTFT.

    Скорость выдачи после первого токена измеряют отдельно (токенов в секунду). Для оценки нужны не средние, а перцентили (p50, p95), потому что выбросы задержки заметны пользователям.

    Пример

    Замер TTFT со стримингом
    1import time
    2
    3def measure_ttft(stream_response, prompt: str) -> float:
    4    start = time.perf_counter()
    5    for _chunk in stream_response(prompt):      # ваш клиент со stream=True
    6        return time.perf_counter() - start      # время до первого фрагмента
    7    raise RuntimeError("пустой ответ")

    Как применять в тестировании ИИ

    Замеряйте TTFT отдельно для «холодного» и «тёплого» запросов и на разной длине контекста, сохраняйте перцентили и сравнивайте между версиями промпта и модели. Порог задавайте по вашему продукту и проверяйте его в CI на стабильном стенде.

    Типичные ошибки

    • Смотреть только среднее и не смотреть p95.
    • Мерить полное время ответа вместо времени до первого токена.
    • Сравнивать замеры с разной длиной контекста и разным состоянием кеша.

    Частые вопросы

    Что такое TTFT?

    Время от отправки запроса до получения первого токена ответа при стриминге. Оно показывает, как быстро пользователь увидит начало ответа, и не зависит от того, насколько длинным будет весь ответ.

    От чего зависит время до первого токена?

    От сети, очереди у провайдера, загрузки модели и длины промпта: чем длиннее контекст, тем дольше его обработка. Кеширование неизменной части промпта у некоторых провайдеров помогает сократить это время.

    На странице

    • Как это работает
    • Пример
    • В тестировании ИИ
    • Типичные ошибки
    • Частые вопросы

    Читайте в блоге

    • Тестирование ИИ: что и когда тестировать в LLM-приложении

    Связанные термины

    • Prompt caching
    • Trace id
    • LLM evals
    Все термины глоссария
    THREADQAПлатформа QA Automation

    О платформе

    Обучаем автоматизации тестирования на Java, Python и iOS. Практические курсы, roadmap, тренажёры и персональные мок-интервью.

    Онлайн 24/7

    Курсы

    • Java QA AutomationNEW
    • Python QA Automation
    • iOS QA Automation
    • Про ThreadQA

    Услуги

    • Мок-собеседования

    Инструменты

    • Roadmap QA
    • Тренажёры
    • QA игры
    • Тренажёр XPath
    • XPath Diner
    • Каталог инструментов
    • Глоссарий ИИ-тестирования

    Контакты

    • Email
      info@threadqa.ru
    • Telegram
      @penolegrus
    Публичная офертаПолитика конфиденциальностиУсловия использования
    © 2026·ThreadQA LMS·Все права защищены