THREADQA
    THREADQA
    Главная
    Курсы
    Java QA AutomationNEW
    Новый курс · уже можно купить
    Python QA Automation
    Pytest, Playwright, Docker
    iOS QA Automation
    XCTest, XCUITest, Fastlane
    Все курсы
    Сравнить Java / Python / iOS
    Практика
    Мок собеседование
    Тренировка перед реальным интервью
    XPath Practice Hub
    Тренажёр XPath-запросов
    Roadmap
    Путь QA-инженера
    Тренажёры
    SQL, Git, Docker, Linux, тест-дизайн
    QA игры
    8 мини-игр для тестировщика
    XPath Dinner
    Практика XPath в игровом формате
    Каталог инструментов
    Инструменты тестирования и сравнения
    Глоссарий ИИ-тестирования
    LLM, RAG, метрики, evals
    С чего начать
    Блог
    FAQ
    Для компаний
    1. Домой
    2. Глоссарий тестирования ИИ
    3. Golden dataset
    Основы оценки

    Golden datasetчто это и как применять в тестировании ИИ

    Также: золотой набор, golden set, эталонный набор кейсов

    Golden dataset (золотой набор) — коллекция проверочных кейсов с заранее известным ожидаемым поведением, на которой систему проверяют при каждом изменении. Для LLM-приложения кейс содержит вопрос, контекст и описание правильного ответа, а набор делят на корзины: типовые, пограничные, вне области, adversarial и регрессии.

    Автор: Олег Пендрак · Обновлено 19 сентября 2026 г.

    Как это работает

    Качество тестирования упирается в качество набора: самый умный судья на случайных кейсах покажет красивые цифры, не связанные с реальностью. Лучший источник кейсов — реальные вопросы пользователей из логов, затем вопросы экспертов и поддержки, баги из продакшена и, с ручной проверкой, синтетика.

    Набор версионируют в репозитории рядом с кодом и держат часть кейсов закрытой (holdout), чтобы не подгонять промпт под известные тесты. Стартовый ориентир — 30–50 продуманных кейсов, дальше набор растёт с каждой найденной ошибкой.

    Пример

    Один кейс набора (JSONL)
    1{
    2  "id": "ret-014",
    3  "bucket": "out_of_scope",
    4  "question": "Посоветуй, какой ноутбук купить для игр?",
    5  "context": "База знаний: доставка, оплата, возврат, гарантия",
    6  "expected_behavior": "Вежливо отказать и предложить менеджера"
    7}

    Как применять в тестировании ИИ

    Корзины позволяют смотреть pass rate по группам кейсов, а не одно среднее, которое скрывает провал в критичной группе. Для критичных корзин (adversarial, регрессии) ставят более высокие пороги и блокируют релиз при провале.

    Типичные ошибки

    • Набор собран «на глаз» из десяти вопросов: нет разнообразия и связи с реальным трафиком.
    • Одна общая оценка на весь набор: средний балл прячет провал в редкой, но опасной корзине.
    • Подгонка промпта под известные кейсы без закрытой части набора.

    Частые вопросы

    Сколько кейсов нужно в golden dataset?

    Начните с 30–50 реальных продуманных кейсов, разложенных по корзинам, и растите набор при каждой найденной ошибке. Важнее разнообразие и покрытие критичных тем, чем общее число.

    Зачем делить golden dataset на корзины?

    Корзины дают отдельный критерий и порог для каждой группы кейсов. Общий средний балл скрывает провал в редких группах, например в prompt injection, а корзины показывают его сразу.

    На странице

    • Как это работает
    • Пример
    • В тестировании ИИ
    • Типичные ошибки
    • Частые вопросы

    Читайте в блоге

    • LLM-as-a-Judge: как автоматически тестировать ответы LLM
    • Как тестировать LLM-чатбота: кейсы, диалоги и golden set

    Связанные термины

    • LLM-as-a-Judge
    • LLM evals
    • Галлюцинация LLM
    Все термины глоссария
    THREADQAПлатформа QA Automation

    О платформе

    Обучаем автоматизации тестирования на Java, Python и iOS. Практические курсы, roadmap, тренажёры и персональные мок-интервью.

    Онлайн 24/7

    Курсы

    • Java QA AutomationNEW
    • Python QA Automation
    • iOS QA Automation
    • Про ThreadQA

    Услуги

    • Мок-собеседования

    Инструменты

    • Roadmap QA
    • Тренажёры
    • QA игры
    • Тренажёр XPath
    • XPath Diner
    • Каталог инструментов
    • Глоссарий ИИ-тестирования

    Контакты

    • Email
      info@threadqa.ru
    • Telegram
      @penolegrus
    Публичная офертаПолитика конфиденциальностиУсловия использования
    © 2026·ThreadQA LMS·Все права защищены