ChatGPT Limits: Token, Message, and File Caps for Free, Plus, Pro, and API

Подробный разбор лимитов ChatGPT: контекстные окна, максимальный вывод, сообщения, загрузка файлов и API. Сравнение планов Free, Plus, Pro и моделей GPT-5.6, GPT-4.1, GPT-4o.

Что такое лимиты ChatGPT и почему они важны

ChatGPT — это мощный AI-ассистент для общения, исследований, написания текстов, программирования и других повседневных задач. Однако его использование ограничено несколькими типами лимитов, которые зависят от плана подписки, выбранной модели и режима ответа. Понимание этих ограничений помогает избежать внезапных остановок в работе и эффективно планировать взаимодействие с сервисом.

Основные лимиты включают контекстное окно (контролирует общий объём информации, доступной для одного запроса), максимальный вывод (ограничивает длину одного ответа), квоту сообщений (сколько запросов можно отправить за определённый период) и лимиты на загрузку файлов. Важно различать эти понятия: контекстное окно и максимальный вывод относятся к одному запросу, а квота сообщений — к частоте использования модели в целом.

OpenAI регулярно корректирует лимиты без предварительного уведомления, обычно в зависимости от загрузки серверов, запуска новых моделей или конкурентного давления. Поэтому цифры, актуальные на момент написания, могут измениться.

Контекстное окно и максимальный вывод: ключевые различия

Контекстное окно — это общая ёмкость токенов, доступная для одного запроса модели. Оно включает инструкции, пользовательский ввод, историю диалога, извлечённые фрагменты, результаты работы инструментов и сгенерированный ответ. Модели рассуждения также используют часть этой ёмкости для внутренних токенов размышления.

Максимальный вывод — это ограничение только на сгенерированные токены. Модель может иметь контекстное окно в миллион токенов, но гораздо меньший лимит вывода. Например, GPT-4.1 принимает до 1 047 576 токенов в контексте, но генерирует не более 32 768 токенов. Если заполнить почти всё контекстное окно исходным материалом, доступное пространство для ответа может сократиться или запрос превысит лимит модели.

Максимальный вывод — это потолок. Ответ может завершиться раньше после выполнения запрошенного формата, достижения условия остановки, срабатывания правила безопасности или использования выделенного бюджета вывода для рассуждения и других сгенерированных токенов.

Лимиты токенов в ChatGPT по планам и режимам

Лимиты токенов в ChatGPT зависят от плана подписки и выбранного режима ответа. На момент написания статьи (март 2026 года) действуют следующие ограничения:

  • Free и Go: базовая модель GPT-5.6 Luna, контекстное окно не указано (предположительно 32K для Instant-режима). Кнопка "Think" также использует GPT-5.6 Luna для вопросов, требующих более глубокого рассуждения.
  • Plus ($20/мес): модель GPT-5.6 Sol. Для Instant-режима — 32K контекста. При ручном выборе рассуждения (Medium, High) — до 256K, разделённых на 128K ввода и 128K максимального вывода.
  • Pro ($200/мес): модель GPT-5.6 Sol Pro. Для Instant — 128K контекста. При ручном выборе рассуждения (Medium, High, Extra High) — до 400K, разделённых на 272K ввода и 128K максимального вывода.

Ползунок рассуждения доступен на веб-версии, мобильных устройствах и десктопе. Автоматическое переключение с Instant на Medium не расходует квоту ручного рассуждения.

Лимиты токенов в OpenAI API по моделям

Лимиты токенов в OpenAI API привязаны к конкретному идентификатору модели, используемому в запросе. Контекстное окно ограничивает общий размер запроса, а максимальный вывод — количество сгенерированных токенов. Уровни использования API могут повышать лимиты пропускной способности, но не изменяют характеристики модели.

Актуальные лимиты для основных моделей:

  • GPT-5.6 Sol, Terra, Luna: контекстное окно 1 050 000 токенов, максимальный вывод 128 000 токенов. Различаются по возможностям и цене.
  • GPT-4.1: контекст 1 047 576 токенов, вывод 32 768 токенов.
  • GPT-4o: контекст 128 000 токенов, вывод 16 384 токена.
  • GPT-4o mini: контекст 128 000 токенов, вывод 16 384 токена.

Важно: контекстное окно описывает общую ёмкость запроса, а не длину ответа. Если запрос содержит 120 000 входных токенов, внутри 128 000-токенного окна остаётся около 8 000 токенов для ответа. Максимальный вывод не отменяет это общее ограничение.

Лимиты сообщений: как работает скользящее окно

Лимиты сообщений в ChatGPT отличаются от лимитов токенов. Квота сообщений контролирует, как часто аккаунт может использовать модель в течение указанного периода, в то время как контекстное окно определяет объём информации в одном запросе.

ChatGPT использует систему скользящего окна, а не ежедневный сброс. Каждое отправленное сообщение запускает таймер, и этот «слот» освобождается после истечения окна. Например, если вы отправили сообщение в 14:15, слот освободится в 17:15 (для 3-часового окна).

Примерные лимиты сообщений (март 2026):

  • Free: ~10 сообщений GPT-4o за 5 часов, ограниченное использование o4-mini, 3 загрузки файлов в день.
  • Plus: 80–150 сообщений GPT-4o за 3 часа, ~40 сообщений GPT-4.1 за 3 часа, ~100 сообщений o3 в неделю, ~300 сообщений o4-mini в день, ~10 Deep Research в месяц.
  • Pro: неограниченное количество сообщений по всем моделям.

На практике лимиты Plus колеблются между 80 и 160 сообщениями GPT-4o за 3 часа в зависимости от загрузки серверов. В часы пик вы можете получить нижнюю границу, а ночью — больше.

Лимиты на загрузку файлов и изображений

Лимиты на загрузку файлов регулируют размер файла, количество токенов в документе, частоту загрузки и хранимые файлы. Эти лимиты не увеличивают контекстное окно, используемое для ответа ChatGPT.

Основные ограничения:

  • Максимальный размер файла: 512 МБ на файл (для файлов, загружаемых в GPT или ChatGPT).
  • Лимит токенов для текста и документов: 2 миллиона токенов на файл (для текстовых файлов; электронные таблицы используют другое правило размера).
  • Размер электронных таблиц: примерно 50 МБ, зависит от размера каждой строки.
  • Размер изображения: 20 МБ на изображение.
  • Скользящая квота загрузки: до 80 файлов каждые 3 часа (может снижаться в пиковые периоды).
  • Квота для бесплатного плана: 3 загрузки файлов в день.
  • Хранимые файлы: 25 ГБ на пользователя, 100 ГБ на организацию.

Эти лимиты действуют независимо от квоты сообщений. Например, вы можете исчерпать лимит загрузок, но продолжать отправлять текстовые запросы.

Токены рассуждения и бюджет вывода в API

Модели рассуждения тратят токены на внутреннее размышление перед созданием видимого текста. Эти токены уменьшают доступный бюджет сгенерированных токенов для видимого ответа. Сложные задачи по программированию, математике, планированию и исследованиям могут потребовать значительную часть бюджета вывода до появления окончательного ответа.

В Responses API параметр max_output_tokens ограничивает общую сумму токенов рассуждения и видимых выходных токенов. Если модель использует полный выделенный бюджет до завершения ответа, возвращается неполный статус с указанием max_output_tokens в качестве причины.

Рекомендуется резервировать достаточную ёмкость вывода для моделей рассуждения перед отправкой большого промпта. Проверяйте объект usage в ответе, чтобы увидеть количество токенов рассуждения и вывода, затем корректируйте размер промпта или выделенный бюджет вывода для последующих запросов.

Как эффективно работать в рамках лимитов

Чтобы максимально эффективно использовать доступные лимиты, следуйте этим практическим советам:

  • Удаляйте дублирующиеся инструкции и нерелевантные примеры из промптов. Это освобождает место в контекстном окне.
  • Разбивайте длинные документы на именованные разделы или диапазоны страниц и запрашивайте анализ конкретных частей.
  • Извлекайте только те фрагменты, которые необходимы для текущего вопроса, вместо загрузки всего документа.
  • Заменяйте длинную историю диалога кратким описанием проекта — это экономит токены.
  • Резервируйте достаточно контекста для рассуждения и финального ответа, особенно при работе с моделями рассуждения.
  • Генерируйте длинные отчёты, код или структурированные данные по частям, в несколько запросов.
  • Используйте модель, чьи лимиты контекста и вывода соответствуют вашей задаче. Например, для анализа больших документов лучше подходит GPT-5.6 Sol или Terra с окном 1 млн токенов.
  • Для простых вопросов используйте o4-mini — у него более высокая дневная квота, чем у GPT-4o.
  • Объединяйте несколько вопросов в одно сообщение вместо отправки быстрых последовательных запросов.
  • Если вы исчерпали лимит GPT-4o, временно переключитесь на другую модель — у каждой модели свой отдельный счётчик сообщений.

Если вы постоянно упираетесь в лимиты Plus, рассмотрите возможность использования API. API взимает плату за токен без квоты сообщений, что может быть более экономичным для активных пользователей в зависимости от паттернов использования.

Почему лимиты постоянно меняются

OpenAI изменяет лимиты ChatGPT как минимум четыре раза в год. Иногда они увеличиваются (например, у Plus временно было 160 сообщений GPT-4o), иногда уменьшаются. Компания не всегда объявляет об изменениях, поэтому пользователи могут заметить, что лимиты отличаются от опубликованных ранее.

Основные факторы, влияющие на изменение лимитов:

  • Загрузка серверов: в часы пик лимиты могут временно снижаться, чтобы обеспечить стабильную работу для всех пользователей.
  • Запуск новых моделей: выход новой модели часто временно снижает лимиты на старые модели, так как вычислительные ресурсы перераспределяются.
  • Конкурентное давление: когда конкуренты (Claude, Gemini) предлагают более щедрые лимиты, OpenAI может отвечать увеличением своих квот.
  • Изменения в инфраструктуре: оптимизация или расширение серверных мощностей позволяет повышать лимиты.

Для получения актуальной информации рекомендуется проверять официальную страницу лимитов OpenAI или настройки аккаунта.

Вопросы и ответы

Что означает сообщение «You've hit your limit» в ChatGPT?

Это сообщение появляется, когда вы исчерпали квоту сообщений для текущей модели на вашем плане. Для бесплатного плана это обычно означает, что вы использовали около 10 сообщений GPT-4o за последние 5 часов. Для Plus — 80–150 сообщений за 3 часа. Решение: подождать, пока скользящее окно освободит слоты, переключиться на другую модель (например, o4-mini) или обновить план до Pro.

В чём разница между контекстным окном и максимальным выводом токенов?

Контекстное окно — это общий объём токенов, доступный для одного запроса, включая ввод, историю и ответ. Максимальный вывод — это ограничение только на сгенерированные токены. Например, модель может иметь контекст 1 млн токенов, но генерировать не более 128 000 токенов. Если вы заполните почти всё контекстное окно входными данными, для ответа останется мало места, даже если максимальный вывод больше.

Как работает скользящее окно лимитов сообщений?

ChatGPT не сбрасывает лимиты в полночь или каждый час. Вместо этого каждое отправленное сообщение запускает таймер, и слот освобождается через 3 часа (для Plus) или 5 часов (для Free). Если вы отправили 80 сообщений за 30 минут, они начнут освобождаться по одному каждые несколько минут, начиная с первого. Это означает, что после достижения лимита вы можете продолжать общение в медленном темпе, если сообщения были распределены во времени.

Какие лимиты на загрузку файлов в ChatGPT?

Максимальный размер файла — 512 МБ. Для текстовых документов — до 2 млн токенов на файл. Для изображений — до 20 МБ. Скользящая квота загрузки — до 80 файлов каждые 3 часа (может снижаться в пиковые периоды). Бесплатный план — 3 загрузки в день. Хранилище — 25 ГБ на пользователя, 100 ГБ на организацию. Эти лимиты не зависят от квоты сообщений.

Можно ли обойти лимиты ChatGPT, используя разные модели?

Да, у каждой модели свой отдельный счётчик сообщений. Если вы исчерпали лимит GPT-4o, вы можете переключиться на o4-mini, GPT-4.1 или другую доступную модель. Это не сбрасывает лимит первой модели, но позволяет продолжить работу. На плане Plus также доступны модели с разными квотами: например, o4-mini имеет ~300 сообщений в день, а o3 — ~100 в неделю.

Почему лимиты ChatGPT меняются без предупреждения?

OpenAI корректирует лимиты в зависимости от загрузки серверов, запуска новых моделей и конкурентной ситуации. В часы пик лимиты могут временно снижаться, а при появлении новых моделей — перераспределяться. Компания не всегда объявляет об изменениях, поэтому рекомендуется проверять официальную страницу лимитов или настройки аккаунта для актуальной информации.

Что такое токены рассуждения и как они влияют на лимиты?

Токены рассуждения — это внутренние токены, которые модели тратят на размышление перед созданием видимого ответа. Они расходуют бюджет вывода, уменьшая доступное пространство для финального текста. В API параметр max_output_tokens ограничивает сумму токенов рассуждения и видимого вывода. Если модель использует весь бюджет на размышление, ответ может быть неполным. Рекомендуется резервировать дополнительную ёмкость для сложных задач.