Один промпт в GPT, Claude и Gemini — сравнение без смены задачи и формата.
Сомелье сравнивают вино в одинаковых бокалах — иначе сравнение бессмысленно. GPT, Claude и Gemini сравнивают на одной задаче, с одним промптом и настройками. Меняешь модель — больше не меняешь ничего. Иначе ты сравниваешь промпты, а не модели.
Одна переменная за раз. Разные промпты, temperature или формат вывода превращают тест в лотерею.
Reasoning-модели (OpenAI o4-mini, extended thinking у Claude) тратят дополнительные токены на внутреннее рассуждение. На сложной математике и коде они часто точнее; на простой классификации или извлечении факта — лишняя трата latency и денег. Сравнивай standard и reasoning на одном промпте и смотри таблицу: качество × токены × время.
?Проверь себя
Ответы стохастичны: один запрос показывает везение. Гони серию входов — типичные и граничные. Результат сравнения валиден только для той задачи, на которой тестировали.
?Проверь себя
Нажми утверждение слева, затем подходящий ответ справа — они соединятся.