Cerebras Systems анонсировала CS-4 — стоечную ИИ-систему, в основе которой три процессора WSE-3 Turboi (WSE-3T). Несмотря на название, это не новый чип: тот же кристалл WSE-3 двухлетней давности (5 нм TSMC, 4 трлн транзисторов, 900 тыс. ядер), но с частотой, поднятой с 1,4 до 2,8 ГГц, что удвоило пропускную способность памяти и производительность в FLOP/s.
Главная новизна — не кремний, а «коробка» вокруг него: CS-4 стала первой настоящей rack-scale системой Cerebras (предыдущий «CS-3 Rack» был просто двумя независимыми CS-3 в одной стойке без объединения вычислений). Новая платформа Nexusi рассчитана на несколько будущих поколений чипов, включая CS-5 и CS-6, и должна снизить стоимость эксплуатации ИИ-дата-центров, где электричество становится главным ограничением масштабирования.
- Один чип WSE-3T: 250 PFLOPSi sparse FP16 (против 125 у WSE-3), 44 ГБ SRAM-памяти, пропускная способность памяти 43,2 Пбайт/с (против 21), фабрика 53,5 Пбайт/с, внешняя сеть 300 ГБ/с (против 150)
- Вся стойка CS-4 (3×WSE-3T): 750 PFLOPS, 132 ГБ SRAM, задержка 2 мкс (вместо 5 у CS-3)
- По данным Хайтек+, система обеспечивает до 10 раз большую пропускную способность на ватт и в 2 раза быстрее CS-3, а также в 30 раз быстрее GPU
- Данные о вводе-выводе расходятся: Хайтек+ указывает 7,2 Тбит/с, техноданя — 900 ГБ/с для всей стойки
- Cerebras не раскрыла точное энергопотребление, но заявила, что стойка даёт «вдвое больше питания на WSE-3 Turbo» — по оценке техноданя, это означает рост с ~27 кВт до ~54 кВт при удвоении частоты
- Архитектура Nexus: питание и вентиляторы спереди, вейферы сзади в вертикальных модулях-«рюкзаках» (backpack), которые подключаются к питанию, жидкостному контуру и сети стойки; сетевое железо выделено в отдельные wafer I/O модули для независимого обновления
- Для запуска моделей на 10 трлн параметров на скорости 1000+ токенов/с потребуются десятки CS-4, так как память на чип осталась прежней — 44 ГБ
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖