Google DeepMind zaprezentowało Gemini Robotics ER 2, zaawansowany model sztucznej inteligencji pełniący rolę „mózgu” dla robotów. Nowa technologia znacząco rozszerza możliwości maszyn w zakresie rozumienia otoczenia, planowania wieloetapowych zadań oraz współpracy w czasie rzeczywistym. Model został zaprojektowany tak, aby roboty mogły płynnie reagować na bodźce fizyczne, eliminując przestoje w procesie decyzyjnym.
Nowa jakość w sterowaniu robotami
Gemini Robotics ER 2 stanowi ewolucję modelu ER 1.6, oferując znacznie lepszą zdolność do analizy ciągłych strumieni wideo. Dzięki temu roboty potrafią samodzielnie monitorować postępy swoich działań, korygować błędy w locie i precyzyjnie określać moment przejścia do kolejnego etapu pracy. System działa jako nadrzędna warstwa logiczna, która przekazuje polecenia do wyspecjalizowanych modeli sterowania ruchem (VLA – Vision-Language-Action) oraz zewnętrznych narzędzi, takich jak wyszukiwarka Google czy autorskie funkcje użytkownika.
Kluczową innowacją jest integracja z API Gemini Live, która wykorzystuje dwukierunkowe strumieniowanie danych. Pozwala to na minimalizację opóźnień, co jest niezbędne w środowisku fizycznym, gdzie każda sekunda ma znaczenie. Robot nie musi już „zatrzymywać się, by pomyśleć”, lecz płynnie łączy analizę z działaniem.
Precyzja w działaniu i rozumienie postępów
Jednym z największych wyzwań w robotyce jest weryfikacja, czy zadanie zostało wykonane poprawnie. Gemini Robotics ER 2 wprowadza dwie kluczowe funkcje, które rozwiązują ten problem:
Współpraca wielu robotów i bezpieczeństwo
Nowa architektura umożliwia koordynację pracy różnych maszyn w tej samej przestrzeni. Dzięki współdzielonemu rozumieniu semantycznemu, roboty o różnych konstrukcjach – na przykład mobilny robot kołowy i humanoidalne ramię – mogą przekazywać sobie zadania, aby wspólnie realizować złożone procesy, których nie wykonałaby jedna jednostka.
Duży nacisk położono również na bezpieczeństwo. Gemini Robotics ER 2 wykazuje wyższą skuteczność w przestrzeganiu instrukcji bezpieczeństwa oraz wykrywaniu obecności ludzi w pobliżu. W sytuacjach zagrożenia model potrafi automatycznie zatrzymać pracę robota i wznowić ją dopiero po ustąpieniu niebezpieczeństwa.
Dostępność dla programistów
Model jest już dostępny dla twórców i inżynierów za pośrednictwem Gemini API oraz Google AI Studio. Umożliwia to budowanie własnych agentów fizycznych, którzy potrafią wchodzić w interakcje z otoczeniem w sposób naturalny i przewidywalny. Przykłady konfiguracji oraz demonstracje możliwości modelu, w tym współpracę z robotem Spot od Boston Dynamics, udostępniono w serwisie GitHub, co ma ułatwić społeczności robotycznej wdrażanie nowych rozwiązań.
