OpenAI раскрыла первые результаты тестов Jalapeño — своего ASIC для инференса больших языковых моделей. По данным компании, на публичном бенчмарке чип обошёл коммерческие конфигурации на NVIDIA по производительности на ватт и по задержке в интерактивных сценариях.
OpenAI опубликовала первые результаты тестирования Jalapeño — собственного ASIC, который компания проектировала специально под инференс больших языковых моделей. В отчёте говорится, что на публичном бенчмарке InferenceX платформа с Jalapeño показала более высокую эффективность на ватт и меньшую end-to-end задержку по сравнению с коммерческими системами на NVIDIA GB200 и GB300.
Что именно сравнивали и на каких моделях
Тесты проводились на трёх open-weight моделях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. По всем трём кейсам OpenAI заявляет преимущество Jalapeño по совокупности ключевых метрик.
Ключевые цифры из бенчмарка
- На пиковых нагрузках — в 1,5–1,9 раза больше «полезной ИИ‑работы» на ватт.
- End-to-end latency — ниже в 1,7–3,6 раза.
- Интерактивные сценарии — прирост производительности 2,1–4,1 раза.
В качестве иллюстрации OpenAI приводит примеры «токенов в секунду на пользователя» (в сравнении с системой конкурента): около 1459 против 535 для GPT-OSS 120B, около 700 против 169 для DeepSeek R1 670B и около 694 против 182 для Kimi K2.5 1T.
Почему так получилось: упор на реальные узкие места инференса
В описании архитектуры Jalapeño OpenAI делает акцент на том, что чип и стек проектировались под современные LLM и агентные нагрузки «как система», а не как набор разрозненных компонентов. Компания одновременно оптимизировала вычислительные блоки, память, сетевое взаимодействие и программную часть, чтобы сократить лишние перемещения данных.
Это важный нюанс для инференса: на стадии prefill ограничением часто становятся вычисления, а во время decode (когда ответ генерируется токен за токеном) сильнее влияет пропускная способность памяти. Дополнительную задержку также может добавлять обмен данными между чипами. В Jalapeño, по словам OpenAI, состояние модели, включая KV-cache, стараются держать максимально близко к вычислительным блокам, а сеть рассматривают как часть общей архитектуры.
Энергопотребление и «честность» сравнения
Для Jalapeño указан TDP 700 Вт, но в тестах устойчивое фактическое потребление, по данным OpenAI, не превышало 550 Вт. При сравнении компания нормализовала результаты с учётом опубликованного энергопотребления сопоставляемых ускорителей.
Любопытная деталь: модели портировали вместе с агентами
Отдельно OpenAI описывает эксперимент: с помощью Codex и GPT-Astra инженеры перенесли на Jalapeño три open-weight модели, которые изначально не входили в производственный план, менее чем за два месяца. Для отдельных attention‑ и MoE‑блоков реализации, сгенерированные ИИ, оказались в 1,5–1,8 раза быстрее решений, написанных экспертами вручную. При этом подчёркивается, что речь идёт именно об отдельных блоках, а не о полной модели целиком.
Что дальше: Jalapeño как слой инфраструктуры, а не замена GPU
По планам OpenAI, развертывание Jalapeño в собственной вычислительной инфраструктуре должно начаться до конца 2026 года. Компания также сообщает, что уже работает над вторым поколением, а архитектура третьего поколения находится в стадии формирования.
При этом OpenAI не позиционирует Jalapeño как «убийцу GPU»: компания прямо говорит, что продолжит использовать NVIDIA и других поставщиков для задач training и inference. Идея Jalapeño — добавить собственный специализированный слой там, где оптимизация под реальные модели и сценарии даёт максимальную отдачу по стоимости и задержке.
Почему это важно обычным пользователям и командам разработки: если заявленные показатели сохранятся на production‑нагрузках, сервисы с LLM смогут быстрее отвечать в диалоговых режимах и дешевле масштабироваться под рост числа «агентных» сценариев — от ассистентов в IDE до автоматизации поддержки и аналитики.
