август 25, 2026

Революция в изчисленията: Cerebras CS-4 смаза традиционните GPU с до 30 пъти по-висока скорост

Компанията Cerebras Systems анонсира CS-4 — четвъртото си поколение хардуер за ускоряване на изкуствения интелект, базирано на новата архитектура Nexus. Според разработчиците, новата стелажна система осигурява до 30 пъти по-висока скорост при извеждане на заключенията (инференс) в сравнение с традиционните системи, разчитащи на графични процесори (GPU).

Архитектура и нови чипове WSE-3 Turbo

В основата на CS-4 са внедрени три нови процесора WSE-3 Turbo (Wafer Scale Engine 3 Turbo), монтирани в един общ шкаф. Всеки от тези монолитни силициеви кристали запазва гигантските си размери и съдържа:

  • 4 трилиона транзистора
  • 900 000 изчислителни ядра
  • 44 GB SRAM памет върху самия чип

В сравнение с предходното поколение, инженерите са успели да увеличат двойно пропускателната способност на паметта — от 21,6 PB/s до 43,2 PB/s. Скоростта на подсистемата за вход/изход (I/O) също е удвоена, достигайки 2,4 Tb/s на узел или общо 7,2 Tb/s за цялата система.

Благодарение на тези подобрения, производителността при FP16 изчисления с разредени матрици нараства двойно — от 125 на 250 PFLOPS за процесор, а за цялата система CS-4 достига 750 PFLOPS. Повишението на скоростта се дължи основно на увеличената работна честота (ориентировъчно от 1,4 GHz до 2,8 GHz), което е съпроводено с нарастване на консумацията на енергия. TDP на ниво стойка CS-4 се оценява на 120–140 kW.

Иновации в захранването и охлаждането

За да постигне тази изчислителна плътност, Cerebras напълно е преосмислила вътрешния дизайн на ИИ сървърите. Модулната архитектура Nexus разделя CS-4 на три основни блока:

  1. Изчислителни възли Wafer-Scale Backpack: Три автономни модула, всеки от които комбинира ускорителя WSE-3 Turbo, преобразувател на захранването и директно течно охлаждане.
  2. Подсистема за захранване: Захранващото напрежение се подава на разстояние едва 0,5 mm от кристалите (спрямо около 50 mm при стандартните платформи с GPU). Това практически елиминира загубите на ниво печатна платка и позволява подаването на по-голяма мощност без прегряване.
  3. I/O подсистема: Осигурява закъснение при комуникация между отделните пластини (wafer-to-wafer) от едва 2 микросекунди.
Революция в изчисленията: Cerebras CS-4 смаза традиционните GPU с до 30 пъти по-висока скорост

Производителност и работа с гигантски модели

Свободата от тесните места при трансфер на данни прави CS-4 изключително подходящ за автономни ИИ агенти и сложни модели за логически заключения (reasoning), където латентността е от критично значение.

Системата е способна да генерира над 1000 токена в секунда за модели с над 10 трилиона параметъра, като архитектурата позволява поддръжката на бъдещи модели с размери над 50 трилиона параметъра. При теста с модела GPT-OSS-120B системата постига зашеметяващите 4400 токена в секунда за един потребител.

В сравнение с предходното си поколение CS-3, новата стойка CS-4 предлага не само 2 пъти по-висока скорост, но и до 10 пъти по-добра енергийна ефективност (реална производителност на ват). Първите доставки на CS-4 към клиентите започват още през текущото тримесечие.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.

source

Сподели: