Firmy AMD oraz Cerebras Systems ogłosiły nawiązanie strategicznej współpracy technologicznej, której celem jest stworzenie nowatorskiego rozwiązania w zakresie wnioskowania (inference) sztucznej inteligencji. Projekt łączy zaawansowane systemy szafowe AMD Helios z architekturą procesorów Cerebras Wafer-Scale Engine, tworząc zintegrowany przepływ pracy zaprojektowany z myślą o aplikacjach wymagających ekstremalnie niskich opóźnień.
Nowa architektura dla wymagających zadań AI
Współczesne obciążenia związane z wnioskowaniem AI stawiają przed infrastrukturą zróżnicowane wymagania. Podczas gdy zadania o dużej skali koncentrują się na maksymalizacji generowania tokenów, nowoczesne zastosowania, takie jak programowanie w czasie rzeczywistym, inteligentni asystenci czy autonomiczni agenci, wymagają błyskawicznego czasu reakcji. Rozwiązanie opracowane przez AMD i Cerebras adresuje te potrzeby poprzez podejście zwane wnioskowaniem rozproszonym (disaggregated inference), w którym dwa kluczowe etapy pracy są optymalizowane niezależnie:
Dzięki połączeniu tych dwóch technologii w jeden zintegrowany proces, firmy dążą do uzyskania wydajności, która pozwoli na zachowanie wysokiej skali operacji bez poświęcania szybkości odpowiedzi. Według przeprowadzonych symulacji, wspólne rozwiązanie ma oferować nawet pięciokrotnie wyższą liczbę tokenów na sekundę w przeliczeniu na wat (T/s/W) w porównaniu do konfiguracji opartych wyłącznie na technologii Cerebras.
AI inference staje się jedną z największych szans infrastrukturalnych w obszarze sztucznej inteligencji, a rosnąca różnorodność zadań wymaga bardziej elastycznego podejścia. AMD Helios zapewnia wiodącą wydajność i skalę dla najszerszego zakresu obciążeń. Razem z Cerebras rozszerzamy to przywództwo na aplikacje najbardziej wrażliwe na opóźnienia, tworząc potężną nową platformę dla agentowej sztucznej inteligencji działającej w czasie rzeczywistym – dr Lisa Su, prezes i dyrektor generalna AMD.
Dostępność i wdrożenie
Cerebras planuje wdrożenie systemów AMD Helios we własnych centrach danych. Wspólna platforma ma być dostępna dla klientów komercyjnych w pierwszej kolejności za pośrednictwem usługi Cerebras Cloud. Start usługi przewidywany jest na drugą połowę 2026 roku.
Andrew Feldman, dyrektor generalny i współzałożyciel Cerebras, podkreślił znaczenie szybkości generowania tokenów w kontekście rozwoju oprogramowania, robotyki oraz odkryć naukowych. Partnerstwo z AMD ma pozwolić na udostępnienie technologii ultra-niskich opóźnień szerszemu gronu odbiorców, co jest kluczowe w systemach, gdzie czas reakcji bezpośrednio wpływa na użyteczność i doświadczenie użytkownika.
