Google wprowadza Gemini 3.1 Flash Live, swój najbardziej zaawansowany model audio, zaprojektowany z myślą o płynnych, naturalnych i niezawodnych konwersacjach w czasie rzeczywistym. Nowa technologia stanowi istotny krok naprzód w rozwoju interfejsów głosowych, oferując wyższą precyzję oraz mniejsze opóźnienia, co przekłada się na bardziej intuicyjne doświadczenia dla użytkowników indywidualnych, przedsiębiorstw oraz programistów.
Większa skuteczność w złożonych zadaniach
Dla twórców oprogramowania i firm kluczowym atutem modelu jest jego zdolność do obsługi skomplikowanych procesów. Gemini 3.1 Flash Live wykazuje znacznie wyższą niezawodność w budowaniu agentów głosowych, którzy muszą realizować wieloetapowe polecenia w wymagających środowiskach. Potwierdzają to wyniki testów wydajnościowych:
- W benchmarku ComplexFuncBench Audio, badającym wywoływanie funkcji z wieloma ograniczeniami, model osiągnął wynik 90,8%, wyprzedzając poprzednie wersje.
- W teście Scale AI’s Audio MultiChallenge, sprawdzającym rozumowanie w warunkach typowych dla naturalnej mowy – takich jak przerwy, wahania czy przerywanie wypowiedzi – model uzyskał wynik 36,1% przy włączonej funkcji „myślenia”.
Ulepszenia objęły również rozumowanie tonalne. System lepiej rozpoznaje niuanse akustyczne, takie jak tempo czy wysokość głosu, co pozwala mu dynamicznie dostosowywać odpowiedzi do emocji użytkownika, na przykład w sytuacjach, gdy rozmówca wykazuje frustrację lub zagubienie. Rozwiązanie to jest już wdrażane przez firmy takie jak Verizon, LiveKit czy The Home Depot.
Dostępność i nowe możliwości dla użytkowników
Model Gemini 3.1 Flash Live jest udostępniany w różnych kanałach, aby wspierać zarówno profesjonalne wdrożenia, jak i codzienne użytkowanie:
- Programiści: Dostęp w wersji zapoznawczej poprzez Gemini Live API w Google AI Studio.
- Przedsiębiorstwa: Wykorzystanie w ramach Gemini Enterprise for Customer Experience.
- Użytkownicy indywidualni: Dostęp poprzez Search Live oraz Gemini Live, które zostały rozszerzone na ponad 200 krajów i terytoriów.
Dzięki nowemu modelowi, Gemini Live oferuje szybsze reakcje i zdolność do podtrzymywania wątku konwersacji przez dwukrotnie dłuższy czas niż dotychczas. Pozwala to na prowadzenie bardziej rozbudowanych sesji burzy mózgów bez utraty kontekstu rozmowy.
Bezpieczeństwo i odpowiedzialność
W trosce o przeciwdziałanie dezinformacji, wszystkie treści audio generowane przez Gemini 3.1 Flash Live są automatycznie oznaczane za pomocą technologii SynthID. Jest to niewyczuwalny dla ludzkiego ucha znak wodny, wpleciony bezpośrednio w wyjściowy sygnał dźwiękowy, co umożliwia niezawodną identyfikację treści stworzonych przez sztuczną inteligencję.
Źródło: Royal Astronomical Society
