Google wprowadza na rynek Gemma 4, najnowszą generację otwartych modeli sztucznej inteligencji, zaprojektowaną z myślą o zaawansowanym rozumowaniu oraz pracy w ramach autonomicznych systemów agentowych. Od momentu debiutu pierwszej wersji, modele z tej rodziny zostały pobrane przez programistów ponad 400 milionów razy, co zaowocowało powstaniem ponad 100 tysięcy wariantów stworzonych przez społeczność. Nowa odsłona, udostępniona na licencji Apache 2.0, ma na celu dalsze wspieranie innowacji poprzez zapewnienie dostępu do technologii klasy światowej.
Nowa rodzina modeli: od urządzeń mobilnych po stacje robocze
Gemma 4 została zaprojektowana w czterech wariantach, które różnią się rozmiarem i przeznaczeniem, oferując wysoką wydajność w stosunku do liczby parametrów:
- Effective 2B (E2B) oraz Effective 4B (E4B): Modele zoptymalizowane pod kątem urządzeń mobilnych i rozwiązań typu edge. Priorytetem jest tu niskie opóźnienie, obsługa multimodalna oraz oszczędność energii i pamięci RAM.
- 26B Mixture of Experts (MoE): Model wykorzystujący architekturę mieszanki ekspertów, który podczas wnioskowania aktywuje jedynie 3,8 miliarda parametrów, co przekłada się na wyjątkowo szybkie generowanie tekstu.
- 31B Dense: Model o gęstej strukturze, stworzony z myślą o maksymalnej jakości odpowiedzi i zaawansowanych zadaniach wymagających dużej mocy obliczeniowej.
W niezależnych testach (Arena AI) model 31B zajął trzecie miejsce wśród wszystkich otwartych modeli na świecie, a wariant 26B uplasował się na szóstej pozycji, wyprzedzając rozwiązania nawet 20-krotnie większe pod względem liczby parametrów.
Kluczowe możliwości techniczne
Gemma 4 wprowadza szereg usprawnień, które czynią ją wszechstronnym narzędziem dla programistów i badaczy:
- Zaawansowane rozumowanie: Modele lepiej radzą sobie z planowaniem wieloetapowym oraz głęboką logiką, co jest widoczne w wynikach testów matematycznych i instrukcyjnych.
- Obsługa agentów: Natywne wsparcie dla wywoływania funkcji (function-calling), formatu JSON oraz systemowych instrukcji pozwala na budowę autonomicznych agentów współpracujących z zewnętrznymi API.
- Multimodalność: Wszystkie modele natywnie przetwarzają obrazy i wideo, a mniejsze warianty (E2B i E4B) dodatkowo obsługują wejście audio.
- Długi kontekst: Modele edge oferują okno kontekstowe o wielkości 128 tys. tokenów, natomiast większe warianty pozwalają na przetwarzanie do 256 tys. tokenów, co umożliwia analizę całych repozytoriów kodu lub długich dokumentów.
- Wielojęzyczność: Modele zostały wytrenowane w ponad 140 językach.
Wydajność i dostępność sprzętowa
Modele Gemma 4 zostały zoptymalizowane tak, aby działać na różnorodnym sprzęcie. Warianty 26B i 31B w formacie bfloat16 mieszczą się w pamięci pojedynczej karty graficznej NVIDIA H100 (80 GB), a dzięki kwantyzacji mogą być uruchamiane lokalnie na komputerach osobistych z konsumenckimi układami GPU. Z kolei modele E2B i E4B, stworzone we współpracy z firmami takimi jak Qualcomm i MediaTek, działają w pełni offline na urządzeniach mobilnych, Raspberry Pi czy NVIDIA Jetson Orin Nano.
Dzięki licencji Apache 2.0, użytkownicy zyskują pełną kontrolę nad infrastrukturą i danymi, co jest kluczowe dla przedsiębiorstw i organizacji dbających o suwerenność cyfrową. Modele są wspierane przez szeroki ekosystem narzędzi, w tym Hugging Face, vLLM, llama.cpp, Ollama oraz platformy chmurowe Google Cloud, co pozwala na łatwe skalowanie rozwiązań od fazy prototypu aż po produkcję.
