Evals: тестовые запросы и критерии качества до выкладки в прод.
«Вроде стало лучше» — не аргумент для прода. Evals — юнит-тесты промптов: версионированный датасет + грейдеры. Поменял формулировку или модель — прогнал evals и видишь в цифрах, лучше или хуже. Без измерения prompt engineering — гадание.
1. Загрузить размеченный датасет. 2. Определить варианты промпта. 3. Прогнать каждый на всех примерах. 4. Посчитать accuracy. 5. Сравнить варианты и выбрать победителя с цифрами.
Eval set версионируют в git: "version": "1.0.0". Любой run-файл записывает, против какой версии считали. Меняешь кейсы — bump patch. Breaking change рубрики — major.
?Проверь себя
Включай граничные и каверзные входы: сарказм, двусмысленность, prompt injection. Провалы на adversarial примерах — самая ценная информация.
Модель прошла eval, но в проде деградирует: data drift (новые темы), concept drift (устаревшие правила в RAG), upstream drift (провайдер обновил модель за alias -latest). Мониторинг judge-score и refusal-rate ловит это раньше пользователей.
?Проверь себя
Нажми утверждение слева, затем подходящий ответ справа — они соединятся.