Утро началось с письма от вендора: цены на токены Qwen срезаны почти вдвое. Первая реакция – «приятно». Вторая – открыть таблицу и пересчитать рабочие сметы, потому что токены – единственная статья расходов бота, которая живёт своей жизнью.
Пересчитал: диалог текстового консультанта, который вчера стоил условные три рубля, сегодня стоит полтора. На объёме юридической сети это заметно – не «разбогатели», но месячный счёт при том же трафике просел ощутимо. А для ботов, где модель дёргается только на свободных фразах, изменение вообще растворилось в копейках – там токены и так были самой маленькой строкой.
Мораль простая, и я повторяю её клиентам в каждой смете: цены на модели – не константа, а погода. Они меняются раз в квартал, и почти всегда вниз. Поэтому привязывать архитектуру к «дорогой» или «дешёвой» модели – ошибка: конвейер должен уметь менять модель одной строчкой конфига, а смету стоит пересчитывать при каждом заметном движении цен. Сегодня ровно тот день.
Как вообще считается смета бота – токены, сервер, разработка – я разбирал в отдельной статье с честными цифрами трёх запущенных проектов.