Почему модель ничего не помнит сама — и как устроено сообщение под капотом
В уроках «Первый промпт: разговор с AI» и «Рабочее пространство: привычки новичка» ты отправил первый промпт и разобрал анатомию чата. Здесь — что происходит под капотом: роли system, user, assistant и почему история пересылается заново.
Каждый раз, когда ты жмёшь «отправить», приложение собирает сообщения и зовёт API. Модель на сервере сама ничего не «помнит» между вызовами — память диалога это то, что ты снова прислал в запросе.
1) Приложение формирует список сообщений. 2) Отправляет в API. 3) Модель генерирует ответ токен за токеном. 4) Приложение показывает текст (часто потоком — streaming) и сохраняет ответ в историю для следующего раза.
Каждый новый вопрос включает всю переписку снова. Десятое сообщение «помнит» девятое, потому что девятое снова в контексте. Больше истории → больше входных токенов → выше цена и риск упереться в лимит окна.
Ответ часто приходит по кусочкам — слово за словом. Это не анимация: модель реально генерирует токен за токеном, и каждый следующий зависит от предыдущих. Пользователь видит текст раньше, чем генерация закончилась.
?Проверь себя
Нажми утверждение слева, затем подходящий ответ справа — они соединятся.
«Память» в ChatGPT — это продуктовая обёртка: хранит историю и подставляет в следующий запрос. Сам вызов API без истории — как разговор с амнезией на один ход.