Токен – минимальный кусочек текста, которым оперирует языковая модель: в среднем 3–4 символа, то есть часть слова, короткое слово целиком или знак препинания. Модель не видит буквы и предложения так, как их видит человек: на вход и выход у неё идёт последовательность токенов. В английском тексте слово – это чаще всего один токен, в русском обычно два-три.
В токенах измеряется всё, что связано с объёмом: контекстное окно модели (сколько она способна удержать за раз), длина ответа и счёт за работу API. Тарифы почти всегда указывают две цены – за токены на входе (ваш запрос вместе с историей диалога и инструкцией) и за токены на выходе (ответ модели), причём выход дороже входа.
Что это даёт на практике: расход становится предсказуемым. Зная среднюю длину запроса и ответа, стоимость обращения считается заранее, и видно, где деньги утекают – чаще всего в раздутом системном промте и в истории переписки, которая тащится в каждый следующий запрос.
О чём стоит помнить: токены не равны словам, поэтому оценка «по символам» врёт. Русский текст при равном смысле дороже английского – токенов на него уходит больше. И разные модели режут текст по-разному: один и тот же документ у двух моделей даст разное число токенов, так что цены сравнивают на своём тексте, а не по прайсу.