Sprawni Cyfrowo

Gemini 3.8 Live: nowe głosowe modele AI od Google

Gemini 3.8 Live: nowe głosowe modele AI od Google

Gemini 3.8 Live to nowa rodzina głosowych modeli AI, którą Google zaprezentował 15 września 2026 roku. Firma udostępniła dwa warianty: Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking. Oba stawiają na rozmowę w czasie zbliżonym do rzeczywistego i mają obsługiwać złożone zadania głosowe, a nie tylko odpowiadać na pojedyncze pytania.

Gemini 3.8 Live przetwarza obraz niemal w czasie rzeczywistym, wykrywa język rozmówcy i płynnie przechodzi między 97 językami w trakcie jednej rozmowy. Model może w tle wywoływać narzędzia oraz interfejsy API bez przerywania dialogu. Wariant Extended Thinking dokłada równoległe rozumowanie: prowadzi wieloetapową analizę, jednocześnie mówiąc, i na bieżąco komentuje postęp zadań uruchomionych w tle.

Co pokazują benchmarki Gemini 3.8 Live

Google podał wyniki kilku testów. W indeksie Artificial Analysis Speech to Speech Quality Index model uzyskał 82,6 punktu i pierwsze miejsce w zestawieniu. W teście rozumowania dźwiękowego Big Bench Audio osiągnął 97,7 procent. W zadaniach agentowych τ-Voice odnotowano 68,6 procent, a w węższym benchmarku bankowym Sierra τ-Voice-banking 35,1 procent. W rankingu Speech Agent Arena Gemini 3.8 Live zajął drugie miejsce. To dane podane przez producenta, więc warto traktować je jako punkt wyjścia, a nie ostateczny dowód.

Modele są dostępne od dnia zapowiedzi. Deweloperzy dostają je przez Gemini API i Google AI Studio, przedsiębiorstwa w prywatnej wersji zapoznawczej Gemini Enterprise, a użytkownicy w Search Live oraz w Google Workspace, Gmail i Keep dla subskrybentów. Ceny nie ujawniono; Google opisuje modele jako oszczędne w skali.

Dla polskich firm ważniejszy jest kierunek niż sam wynik testu. Interfejs głosowy z rozumowaniem w tle i wywoływaniem narzędzi zbliża asystenta do roli agenta, który wykonuje czynności, a nie tylko informuje. Przy wdrożeniu warto sprawdzić, do jakich systemów model faktycznie sięga, gdzie przetwarzane są nagrania głosu w świetle RODO oraz w których momentach decyzję zatwierdza człowiek. Obsługa 97 języków obejmuje polski, ale jakość rozmowy trzeba przetestować na własnych scenariuszach, nie na wynikach dostawcy.

Źródło: Google — The Keyword (EN), 15 września 2026.

Pomożemy Ci wdrożyć sztuczną inteligencję w Twojej firmie.

Konsultacje i wdrożenia AI

Powiązane artykuły