Контекстное окно – максимальный объём текста, который модель способна удержать за один раз, считая и то, что вы прислали, и то, что она ответит. Измеряется в токенах. В окно помещается всё сразу: системная инструкция, история переписки, подложенные документы и сам вопрос. Никакой памяти за пределами окна у модели нет – между запросами она не помнит ничего.
Отсюда типовая механика диалога: чтобы бот «помнил» разговор, всю переписку отправляют заново в каждом запросе. Когда она перестаёт помещаться, старые реплики выбрасывают или сжимают в короткое резюме. Современные модели заявляют окна в сотни тысяч токенов – это уже уровень книги или пачки договоров.
Что даёт большое окно: можно положить целый документ и спрашивать по нему, не разрезая на куски, и вести длинный диалог без потери нити.
О чём умалчивают цифры в рекламе: заполнять окно целиком обычно невыгодно и вредно. Каждый запрос оплачивается по всем токенам входа, поэтому раздутый контекст бьёт по счёту напрямую. Качество тоже не линейно: на длинных текстах модели заметно хуже замечают детали в середине – начало и конец «слышны» лучше. Поэтому чаще выигрывает не «положить всё», а найти и положить нужное.