Что модель «помнит», что забывает — и почему разговор теряет нить
В уроке «Токены и контекст: что AI помнит» ты впервые встретил контекстное окно и токены. Здесь — как окно работает в реальном чате: что модель «помнит», что выпадает и почему длинные диалоги теряют нить.
Ты знаешь: LLM предсказывает следующий токен. Но что именно она «видит» в чате? Не весь интернет и не всю историю жизни — только то, что помещается в контекстное окно прямо сейчас.
Контекстное окно — лимит токенов за один запрос: системные инструкции + вся переписка + твой новый вопрос. Всё вместе не может превысить лимит модели. Что не влезло — для модели не существует.
Представь стол: на него помещается N листов. Всё на столе — модель учитывает. Что упало на пол — исчезло. Длинный чат заполняет стол; старые сообщения вытесняются новыми. Модель не «забывает из вредности» — она просто не видит то, что за пределами окна.
Важный факт из интеграции LLM: сервер не хранит «память» между вызовами сам по себе. Приложение (ChatGPT, твой бот) каждый раз отправляет историю заново. AI «помнит» диалог, потому что весь чат снова попадает в контекст. Новый чат = пустой стол.
Раньше типичный лимит — 4 000–8 000 токенов. Сейчас у топ-моделей — 128 000–200 000 и больше. Но лимит всё равно есть. И даже внутри большого окна середина длинного текста усваивается хуже — эффект «lost in the middle».
?Проверь себя
Варианты снизу — перетащи в слот или нажми. Нажми на ответ — вернуть вниз.
Твой ответ
Варианты
Правила и роль — в системный промпт в начале. Документ для анализа — прямо перед вопросом. Не надейся, что модель «найдёт» важное в середине простыни текста.