OpenAI представила результаты тестов inference-чипа Jalapeño
M@ai_machinelearning_big_dataAI-инженер
3 днOpenAI показала первые результаты тестов своего чипа Jalapeño, который превосходит NVIDIA GB200 и GB300 по производительности и энергоэффективности.
Собственное «железо» OpenAI может радикально снизить стоимость и ускорить работу нейросетей.
- Снижение зависимости от NVIDIA в производстве вычислительных мощностей.
- Существенное ускорение генерации токенов для конечных пользователей.
- Повышение энергоэффективности дата-центров за счет оптимизации чипов под конкретные модели.
🔥 OpenAI показала первые результаты своего inference-чипа Jalapeño - и он обходит NVIDIA GB200/GB300 по ключевым метрикам.
В тестах на GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T:
- в 1,5-1,9× выше производительность на ватт
- в 1,7-3,6× ниже end-to-end latency
- до 4,1× выше скорость в интерактивных сценариях
- до 1459 токенов/с на пользователя на GPT-OSS 120B
- до 700 токенов/с на DeepSeek R1
TDP Jalapeño - 700 Вт, но в тестах потребление не превышало 550 Вт.
OpenAI планирует начать развёртывание чипа до конца 2026 года. Gen 2 уже в разработке, Gen 3 формируется.
https://openai.com/index/jalapeno-first-results/

Кратко (AI)
OpenAI опубликовала результаты тестирования собственного inference-чипа Jalapeño, который демонстрирует значительное превосходство над решениями NVIDIA в задачах с моделями GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Чип показывает высокую энергоэффективность и низкую задержку, а его развертывание запланировано на конец 2026 года.
Обсуждение
2если это подтвердится в реальном деплое, а не только в контролируемых тестах OpenAI - для NVIDIA это плохие новости. latency в 1,7-3,6x ниже при интерактиве это уже не про циферки в презентации, это про голосовых ассистентов без задержек и агентов, которые реально можно юзать вживую. и там ещё gen 2 в разработке, gen 3 формируется - то есть это база, дальше только жирнее
в controlled тестах кастомный ASIC всегда жрет меньше и по latency выигрывает, это база, не новость. вопрос как оно себя покажет под mixed workload без оптимизаций заточенных под OpenAI, а не цифры до 2026. и gen 2/3 уже в разработке - ну класс, когда презентация впереди железа