Инференс – работа уже обученной модели: она получает запрос и выдаёт ответ. Обучение происходит один раз и стоит дорого, инференс происходит каждый раз, когда пользователь нажал «отправить». В продакшене вы платите именно за инференс – деньгами за токены, если модель чужая, или счетами за сервер, если своя.
Скорость инференса описывают двумя числами: время до первого токена и скорость выдачи дальнейших. Для чата важнее первое – ответ, который начал появляться, воспринимается как быстрый. Ускоряют его укороченным контекстом, моделью поменьше, пакетной обработкой запросов и специальными серверами, которые умеют обслуживать много обращений одной загруженной моделью.
Что это даёт понимать на практике: становится видно, где деньги. Модель, которая на тестах выглядит чуть умнее, в проде может оказаться вдвое дороже и заметно медленнее – при том что разницы в ответах пользователь не замечает.
На что смотреть: считать стоимость надо на реальном трафике, а не на демонстрации. Своя модель на своём сервере дешевеет только при постоянной загрузке – простаивающая видеокарта стоит столько же, сколько работающая. При редких обращениях чужой API почти всегда выгоднее.