THREADQA
    THREADQA
    Главная
    Курсы
    Java QA AutomationNEW
    Новый курс · уже можно купить
    Python QA Automation
    Pytest, Playwright, Docker
    iOS QA Automation
    XCTest, XCUITest, Fastlane
    Все курсы
    Сравнить Java / Python / iOS
    Практика
    Мок собеседование
    Тренировка перед реальным интервью
    XPath Practice Hub
    Тренажёр XPath-запросов
    Roadmap
    Путь QA-инженера
    Тренажёры
    SQL, Git, Docker, Linux, тест-дизайн
    QA игры
    8 мини-игр для тестировщика
    XPath Dinner
    Практика XPath в игровом формате
    Каталог инструментов
    Инструменты тестирования и сравнения
    Глоссарий ИИ-тестирования
    LLM, RAG, метрики, evals
    С чего начать
    Блог
    FAQ
    Для компаний
    1. Домой
    2. Глоссарий тестирования ИИ
    3. Чанкинг
    RAG и поиск

    Чанкингчто это и как применять в тестировании ИИ

    Также: chunking, разбиение на чанки, размер чанка, chunk size

    Чанкинг — разбиение документов на небольшие фрагменты (чанки), которые индексируют и находят при поиске в RAG. Ключевые параметры — размер чанка и перекрытие (overlap) между соседними. Слишком мелкие чанки теряют контекст, слишком крупные размывают релевантность, поэтому значения подбирают экспериментом.

    Автор: Олег Пендрак · Обновлено 19 сентября 2026 г.

    Как это работает

    Чанк должен содержать законченную мысль: если факт разрезан на два чанка, поиск найдёт обрывок, и ответ будет неполным. Overlap помогает сохранить смысл на границах, но слишком большой создаёт дубли в выдаче.

    Границы лучше проводить по смысловым единицам: абзацам, заголовкам, пунктам. Простое разбиение по числу символов быстро реализуется, но чаще режет факты посередине.

    Пример

    Простое разбиение по символам с overlap
    1def split(text: str, size: int = 500, overlap: int = 50) -> list[str]:
    2    step = size - overlap
    3    return [text[i:i + size] for i in range(0, len(text), step)]

    Как применять в тестировании ИИ

    Меняя размер чанка или overlap, пересчитывайте hit rate@k, recall и precision на наборе для поиска и сравнивайте с прошлым прогоном. Меняйте по одному параметру за раз и фиксируйте настройки чанкинга в записи прогона.

    Типичные ошибки

    • Менять размер чанка без замеров: оптимум зависит от ваших документов.
    • Резать текст по числу символов, разрывая факты и таблицы.
    • Не пересобирать метрики после смены настроек чанкинга.

    Частые вопросы

    Какой размер чанка выбрать для RAG?

    Универсального значения нет. Слишком мелкие чанки теряют контекст, слишком крупные размывают релевантность. Подберите размер экспериментом, измеряя hit rate, recall и precision на своих вопросах.

    Зачем нужен overlap между чанками?

    Перекрытие сохраняет смысл на границах чанков, чтобы факт не потерялся при разрезании. Слишком большой overlap создаёт дубли и почти одинаковые фрагменты в выдаче.

    На странице

    • Как это работает
    • Пример
    • В тестировании ИИ
    • Типичные ошибки
    • Частые вопросы

    Читайте в блоге

    • Тестирование RAG: как понять, что сломалось — поиск или генерация

    Связанные термины

    • RAG
    • Top-k в поиске (RAG)
    • Hit rate@k
    • Context recall
    Все термины глоссария
    THREADQAПлатформа QA Automation

    О платформе

    Обучаем автоматизации тестирования на Java, Python и iOS. Практические курсы, roadmap, тренажёры и персональные мок-интервью.

    Онлайн 24/7

    Курсы

    • Java QA AutomationNEW
    • Python QA Automation
    • iOS QA Automation
    • Про ThreadQA

    Услуги

    • Мок-собеседования

    Инструменты

    • Roadmap QA
    • Тренажёры
    • QA игры
    • Тренажёр XPath
    • XPath Diner
    • Каталог инструментов
    • Глоссарий ИИ-тестирования

    Контакты

    • Email
      info@threadqa.ru
    • Telegram
      @penolegrus
    Публичная офертаПолитика конфиденциальностиУсловия использования
    © 2026·ThreadQA LMS·Все права защищены