Почему длинные чаты «ломаются» и когда начинать новый
Ты уже отправил первый промпт — и, возможно, заметил странности. Модель «забыла» начало длинного разговора. Сосчитала слова неточно. Ответила уверенно, но неверно. Это не баг — это следствие того, как устроены языковые модели. Разберём два ключевых ограничения: токены и контекстное окно.
Модель не читает буквы и даже не всегда целые слова. Она работает с токенами — короткими фрагментами текста. Слово «привет» может быть одним токеном, а редкое слово — разбито на несколько. На русском текст обычно «дороже» в токенах, чем на английском: больше символов на слово.
Каждый токен — единица работы модели. От количества токенов зависит скорость ответа и (на платных тарифах) стоимость. Фраза «Сократи этот текст вдвое» может сэкономить токены. А вот лишние пробелы и повторы — наоборот, тратят бюджет контекста.
Слово « tokenization» в английском может быть одним токеном, а длинное редкое слово — пятью. Модель никогда не видит «слово целиком» — она оперирует числовыми кодами этих кусков.
Контекстное окно — сколько текста модель «видит» за один раз: твой промпт, предыдущие сообщения в чате и место для ответа. У разных моделей разный лимит — от десятков тысяч до сотен тысяч токенов. Когда диалог становится длинным, начало может «выпасть» из окна — модель буквально его не видит.
?Проверь себя
Новая задача — новый чат. Длинный проект — кратко напоминай контекст в начале или прикладывай ключевые факты заново. Не полагайся на то, что модель «помнит всё».