OpenAI пересмотрела стоимость моделей GPT‑5.6: Luna стала заметно дешевле, Terra тоже подешевела, а для Sol появился ускоренный режим. Разбираемся, как это повлияет на счета за токены, скорость ответов и выбор модели под разные задачи.
OpenAI обновила условия использования семейства GPT‑5.6 в API: две модели стали дешевле, а для третьей появился новый режим ускоренной обработки. На практике это означает более предсказуемые расходы для продуктов с большим объёмом запросов и дополнительный «рычаг» управления задержками там, где важна скорость ответа.
Что именно изменилось в ценах
В обновлённом прайсинге сильнее всего подешевела модель GPT‑5.6 Luna — снижение составило 80%. Модель GPT‑5.6 Terra стала дешевле на 20%. Стоимость GPT‑5.6 Sol при этом не изменилась.
- Luna: $0.20 за 1 млн входных токенов и $1.20 за 1 млн выходных токенов.
- Terra: $2 за 1 млн входных токенов и $12 за 1 млн выходных токенов.
- Sol: цена прежняя (без изменений).
OpenAI также уточнила, что новые цены отражаются в том, как расход «кредитов» учитывается в подписках Codex и ChatGPT Work: сами тарифы и лимиты не меняются, но Luna и Terra «съедают» меньше кредитов.
Fast mode для Sol: ставка на скорость вместо экономии
Одновременно с ценовыми изменениями OpenAI запустила для GPT‑5.6 Sol новый режим Fast mode. Он пришёл на смену прежнему Priority Processing.
Суть простая: Fast mode даёт до 2,5× более высокую скорость по сравнению со стандартным режимом, но стоит в 2 раза дороже. При этом OpenAI подчёркивает, что качество ответов не меняется — отличие именно в приоритизации и скорости обработки.
Как включать Fast mode в API
Есть два варианта:
- использовать новый флаг
service_tier: "fast"; - использовать старый параметр
priority— он автоматически перенаправляется в Fast mode.
Sol на Cerebras: ещё быстрее, но пока не для всех
Отдельно компания подтвердила, что GPT‑5.6 Sol уже запускается на инфраструктуре Cerebras со скоростью до 750 токенов в секунду, но доступ пока ограничен: это превью для выбранных клиентов.
Это укладывается в понятную стратегию: ускорять «фронтирные» модели для сценариев, где задержка решает всё — например, голосовые интерфейсы, ассистенты, которые работают «вживую» в чатах поддержки, и инструменты, которые должны быстро проходить длинные цепочки рассуждений.
Почему новость важна обычным пользователям, а не только разработчикам
Хотя изменения формально касаются API и подписок, эффект от них обычно проявляется в конечных продуктах. Если разработчики платят меньше за обработку запросов или могут «докупать скорость» точечно, у них появляется выбор:
- сделать функции на базе ИИ дешевле (или хотя бы не поднимать цены);
- ускорить ответы там, где раньше приходилось экономить на качестве или объёме;
- развести модели по задачам: массовые операции отдавать на более доступную модель, а сложные — оставлять более дорогой.
В итоге такие обновления чаще всего не про «ещё одну цифру в прайсе», а про то, что ИИ‑функции постепенно становятся более массовыми — и в бизнес‑инструментах, и в пользовательских сервисах.
