Как это работает
Низкая температура подходит для задач, где важна стабильность: извлечение данных, классификация, ответы по базе знаний. Высокая подходит для творческих задач, но увеличивает разброс и риск ошибок.
Даже при температуре 0 полная детерминированность не гарантируется: на результат могут влиять особенности инфраструктуры провайдера. Диапазоны допустимых значений и поведение параметра различаются у провайдеров, поэтому сверяйтесь с документацией вашего.
Пример
1GENERATION_PARAMS = {
2 "temperature": 0.2, # низкая: стабильные ответы по базе знаний
3 "top_p": 0.9,
4 "max_tokens": 600,
5}
6# фиксируйте параметры в записи каждого прогона тестовКак применять в тестировании ИИ
Фиксируйте параметры генерации в записи прогона и не меняйте их вместе с промптом. Если система недетерминирована, запускайте каждый кейс несколько раз и смотрите на долю успехов, а стабильность оценивайте отдельно.
Типичные ошибки
- Считать, что температура 0 гарантирует одинаковый ответ на каждый запуск.
- Тестировать на одной температуре, а в проде использовать другую.
- Менять одновременно temperature и top-p: непонятно, что повлияло на результат.
Частые вопросы
Что делает temperature в LLM?
Управляет случайностью выбора следующего токена. Низкое значение делает ответы стабильными и предсказуемыми, высокое — более разнообразными и менее надёжными.
Гарантирует ли температура 0 одинаковые ответы?
Нет. Она делает выбор почти жадным, но полную детерминированность не гарантирует: на результат могут влиять детали инфраструктуры. Поэтому стабильность нужно измерять повторными запусками.