Как это работает
Качество тестирования упирается в качество набора: самый умный судья на случайных кейсах покажет красивые цифры, не связанные с реальностью. Лучший источник кейсов — реальные вопросы пользователей из логов, затем вопросы экспертов и поддержки, баги из продакшена и, с ручной проверкой, синтетика.
Набор версионируют в репозитории рядом с кодом и держат часть кейсов закрытой (holdout), чтобы не подгонять промпт под известные тесты. Стартовый ориентир — 30–50 продуманных кейсов, дальше набор растёт с каждой найденной ошибкой.
Пример
1{
2 "id": "ret-014",
3 "bucket": "out_of_scope",
4 "question": "Посоветуй, какой ноутбук купить для игр?",
5 "context": "База знаний: доставка, оплата, возврат, гарантия",
6 "expected_behavior": "Вежливо отказать и предложить менеджера"
7}Как применять в тестировании ИИ
Корзины позволяют смотреть pass rate по группам кейсов, а не одно среднее, которое скрывает провал в критичной группе. Для критичных корзин (adversarial, регрессии) ставят более высокие пороги и блокируют релиз при провале.
Типичные ошибки
- Набор собран «на глаз» из десяти вопросов: нет разнообразия и связи с реальным трафиком.
- Одна общая оценка на весь набор: средний балл прячет провал в редкой, но опасной корзине.
- Подгонка промпта под известные кейсы без закрытой части набора.
Частые вопросы
Сколько кейсов нужно в golden dataset?
Начните с 30–50 реальных продуманных кейсов, разложенных по корзинам, и растите набор при каждой найденной ошибке. Важнее разнообразие и покрытие критичных тем, чем общее число.
Зачем делить golden dataset на корзины?
Корзины дают отдельный критерий и порог для каждой группы кейсов. Общий средний балл скрывает провал в редких группах, например в prompt injection, а корзины показывают его сразу.