Революция в изчисленията: Cerebras CS-4 смаза традиционните GPU с до 30 пъти по-висока скорост
Компанията Cerebras Systems анонсира CS-4 — четвъртото си поколение хардуер за ускоряване на изкуствения интелект, базирано на новата архитектура Nexus. Според разработчиците, новата стелажна система осигурява до 30 пъти по-висока скорост при извеждане на заключенията (инференс) в сравнение с традиционните системи, разчитащи на графични процесори (GPU).
Архитектура и нови чипове WSE-3 Turbo
В основата на CS-4 са внедрени три нови процесора WSE-3 Turbo (Wafer Scale Engine 3 Turbo), монтирани в един общ шкаф. Всеки от тези монолитни силициеви кристали запазва гигантските си размери и съдържа:
- 4 трилиона транзистора
- 900 000 изчислителни ядра
- 44 GB SRAM памет върху самия чип
В сравнение с предходното поколение, инженерите са успели да увеличат двойно пропускателната способност на паметта — от 21,6 PB/s до 43,2 PB/s. Скоростта на подсистемата за вход/изход (I/O) също е удвоена, достигайки 2,4 Tb/s на узел или общо 7,2 Tb/s за цялата система.
Благодарение на тези подобрения, производителността при FP16 изчисления с разредени матрици нараства двойно — от 125 на 250 PFLOPS за процесор, а за цялата система CS-4 достига 750 PFLOPS. Повишението на скоростта се дължи основно на увеличената работна честота (ориентировъчно от 1,4 GHz до 2,8 GHz), което е съпроводено с нарастване на консумацията на енергия. TDP на ниво стойка CS-4 се оценява на 120–140 kW.
Иновации в захранването и охлаждането
За да постигне тази изчислителна плътност, Cerebras напълно е преосмислила вътрешния дизайн на ИИ сървърите. Модулната архитектура Nexus разделя CS-4 на три основни блока:
- Изчислителни възли Wafer-Scale Backpack: Три автономни модула, всеки от които комбинира ускорителя WSE-3 Turbo, преобразувател на захранването и директно течно охлаждане.
- Подсистема за захранване: Захранващото напрежение се подава на разстояние едва 0,5 mm от кристалите (спрямо около 50 mm при стандартните платформи с GPU). Това практически елиминира загубите на ниво печатна платка и позволява подаването на по-голяма мощност без прегряване.
- I/O подсистема: Осигурява закъснение при комуникация между отделните пластини (wafer-to-wafer) от едва 2 микросекунди.

Производителност и работа с гигантски модели
Свободата от тесните места при трансфер на данни прави CS-4 изключително подходящ за автономни ИИ агенти и сложни модели за логически заключения (reasoning), където латентността е от критично значение.
Системата е способна да генерира над 1000 токена в секунда за модели с над 10 трилиона параметъра, като архитектурата позволява поддръжката на бъдещи модели с размери над 50 трилиона параметъра. При теста с модела GPT-OSS-120B системата постига зашеметяващите 4400 токена в секунда за един потребител.
В сравнение с предходното си поколение CS-3, новата стойка CS-4 предлага не само 2 пъти по-висока скорост, но и до 10 пъти по-добра енергийна ефективност (реална производителност на ват). Първите доставки на CS-4 към клиентите започват още през текущото тримесечие.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.









