Почему «кот» и «кошка» — это разное количество кирпичиков
В уроке «Токены и контекст: что AI помнит» ты узнал, что модель работает с токенами, а не буквами. Здесь — как строится словарь (BPE), почему русский «дороже» и как считать бюджет контекста.
Модель не читает буквы — она читает токены. От того, как текст режется на куски, зависят счёт в API, лимит контекста и даже то, «поместится» ли твой документ.
Токен — единица текста для модели: часть слова, целое короткое слово или знак. «Нейросеть» может стать «нейро» + «сеть». «Кот» — часто один токен. Примерно: 1 токен ≈ 3–4 символа латиницы; кириллица часто «дороже» в токенах.
Популярный метод — Byte-Pair Encoding (BPE). Идея простая: начинаем с отдельных символов (или байтов). Смотрим, какие пары встречаются чаще всего — и склеиваем их в новый токен. «th» + «e» → «the». Повторяем много раз. Частые слова становятся одним токеном, редкие — разбиваются на куски. Незнакомое слово всё равно можно собрать из частей — «неизвестного» токена нет.
В API платишь за входные и выходные токены. Контекстное окно тоже в токенах. «Сократи текст» иногда значит «сократи токены» — а это не то же самое, что символы: пробелы, регистр и редкие слова считаются иначе.
?Проверь себя
Один и тот же смысл на русском может занять в 1,5–2 раза больше токенов, чем на английском. В API это прямо влияет на цену и на то, сколько текста влезет в окно.