Przejdź do treści

Gemini 3.8 Live: głosowy asystent na żywo

Gemini 3.8 Live rozumuje w trakcie rozmowy głosowej. Sprawdź, co potrafi asystent na żywo, ile kosztuje minuta i czy sprawdzi się w Twojej firmie usługowej.

Gemini 3.8 Live to model Google do rozmów głosowych w czasie rzeczywistym, który rozumuje w trakcie rozmowy: słucha, sprawdza dane w tle i odpowiada głosem, bez przerywania połączenia. Google udostępnił go 15 września 2026 przez Live API, AI Studio i aplikację Gemini. Ten artykuł jest dla właścicieli firm usługowych, które odbierają wiele telefonów: wyjaśniam, co taki asystent głosowy AI na żywo potrafi, ile kosztuje minuta rozmowy oraz kiedy voice agent dla firmy się opłaca, a kiedy wystarczy czat tekstowy. Jasno rozgraniczam: rozmowy głosowe AI to temat branżowy, a nie usługa Czatowy.

TL;DR: Gemini 3.8 Live (premiera 15 września 2026) prowadzi rozmowy głosowe na żywo i rozumuje w ich trakcie, także po polsku. Wariant Extended Thinking zdobywa 82,6 pkt w rankingu Artificial Analysis oraz 68,6% w teście tau-Voice. Minuta rozmowy kosztuje od około 0,023 USD, a wariant z głębszym rozumowaniem około 3,50 USD za godzinę wejścia. Dla firmy usługowej sprawdza się w odbieraniu telefonów poza godzinami i wstępnej kwalifikacji, ale przy płatnościach i danych wrażliwych zachowaj nadzór człowieka.

Gemini 3.8 Live w 60 sekund

Gemini 3.8 Live to generatywny model audio od Google, zaprojektowany do prowadzenia rozmowy głosowej w obie strony z opóźnieniem liczonym w setkach milisekund. Premiera miała miejsce 15 września 2026, o czym Google poinformował na blogu dla deweloperów, a dostęp jest możliwy przez Live API, środowisko AI Studio (dokumentacja Live API) oraz aplikację Gemini, także w planie darmowym. Istnieją dwa warianty modelu: standardowy, zoptymalizowany pod płynną rozmowę i niższy koszt, oraz Extended Thinking, który dłużej analizuje treść przed odpowiedzią, lepiej radzi sobie w zadaniach wieloetapowych i to on zajął czołowe miejsca w benchmarkach opisanych niżej. Odróżnij go od Live Avatar, czyli awatara wideo, który Google udostępnił szerzej 24 września 2026 tylko w pakiecie Gemini Enterprise: awatar to twarz na ekranie, a 3.8 Live to głos i rozumowanie pod spodem.

Co potrafi asystent, który rozumuje na żywo

Starsze boty głosowe działały w trzech krokach: zamień mowę na tekst, pomyśl, zamień tekst na mowę. Każde przejście dokładało sekundy ciszy i gubiło kontekst, więc rozmowa brzmiała jak wywiad z opóźnieniem. Gemini 3.8 Live przetwarza dźwięk bezpośrednio, słyszy intonację, pauzy i wtrącenia, a rozumowanie działa równolegle z mówieniem. W praktyce słychać trzy różnice od pierwszego telefonu.

Rozmowa bez przerywania połączenia

Asystent prowadzi naturalną wymianę zdań: dopuszcza wchodzenie w słowo, pauzuje, gdy dzwoniący mu przerywa, i wraca do przerwanego wątku. Potrafi też wywoływać narzędzia w tle, czyli w trakcie rozmowy sprawdzić wolny termin w kalendarzu albo status zlecenia, a potem dokończyć zdanie z konkretem. Dla klienta różnica jest prosta: zamiast sztywnego menu z cyframi słyszy rozmówcę, który pamięta, co padło minutę wcześniej.

Wywołania narzędzi w tle rozmowy

Rozumowanie na żywo oznacza, że model planuje kolejne kroki, zanim skończy mówić: formułuje zapytanie do systemu rezerwacji, czeka na odpowiedź i wplata wynik w następne zdanie. Test tau-Voice, który mierzy właśnie takie agentowe rozmowy telefoniczne, daje wariantowi Extended Thinking 68,6%, czyli wyraźnie powyżej starszych rozwiązań. Granica też istnieje: w bankowej odmianie tego testu wynik spada do 35,1%, więc zadania z pieniędzmi i uprawnieniami nadal wymagają ostrożności.

97 języków, w tym polski

Model obsługuje 97 języków, a polski należy do najlepiej wspieranych: rozumie odmianę, szyki przestawne i typowe dla nas wtrącenia w rodzaju no, yyy czy halo. W praktyce przetestuj trzy rzeczy: nazwiska i nazwy ulic, liczby z jednostkami oraz przerywanie w pół słowa. Wniosek praktyczny: polski w zwykłej rozmowie działa dobrze, ale bazę wiedzy o firmie pisz prostymi zdaniami, bo model czyta ją na głos dosłownie.

Jakość rozmów: liczby i co znaczą

Poniższa tabela zbiera wyniki wariantu Gemini 3.8 Live Extended Thinking, który przy premierze 15 września 2026 zajął czołowe miejsca w rankingach. Każdy wynik opisuję tak, byś wiedział, co realnie obiecuje firmie odbierającej telefony.

TestWynikCo to znaczy dla firmy
Artificial Analysis, tryb mowa do mowy (Extended Thinking)82,6 pkt, pierwsze miejsce (dane z 16 września 2026, Datanorth)ogólna jakość rozmowy głosowej, w tym naturalność i rozumienie
tau-Voice, rozmowy agentowe (Extended Thinking)68,6% (MarkTechPost)skuteczność w zadaniach typu rezerwacja czy zmiana terminu
tau-Voice-banking, operacje bankowe (Extended Thinking)35,1%płatności i dane wrażliwe nadal dla człowieka lub pod jego nadzorem
Big Bench Audio, rozumienie dźwięku (Extended Thinking)97,7%rozpoznawanie mowy, intencji i dźwięków w tle na bardzo wysokim poziomie

Czytaj te liczby z rezerwą typową dla benchmarków producenta: testy laboratoryjne premiują czyste nagrania, a prawdziwy telefon to gwar, słaby zasięg i klient, który mówi równocześnie z radiem. Mimo to przepaść między 68,6% w zwykłych zadaniach a 35,1% w bankowości mówi wprost, gdzie dziś leży granica zaufania.

Ile kosztuje minuta rozmowy

Google wycenił model na 0,005 USD za minutę dźwięku wejściowego i 0,018 USD za minutę dźwięku wyjściowego, co przy typowej rozmowie daje około 0,023 USD za minutę, czyli 1,38 USD za godzinę dialogu. Wariant Extended Thinking z głębszym rozumowaniem kosztuje około 3,50 USD za godzinę samego wejścia, czyli ponad cztery razy więcej niż standardowy wariant (około 0,84 USD za godzinę wejścia). Dla porównania analogiczna oferta głosowa OpenAI to około 5,83 USD za godzinę (porównanie cen Datanorth), więc wariant Extended Thinking wszedł na rynek z ceną o około 40% niższą. Pamiętaj, że to ceny samego API z września 2026: dochodzą do nich wdrożenie, integracja z kalendarzem lub CRM oraz opieka, a stawki producentów zmieniają się kilka razy w roku.

Policz to na własnym przykładzie: 200 minut rozmów miesięcznie w wariancie standardowym to około 4,60 USD samego modelu, czyli poniżej 20 zł. Model to jednak najmniejsza pozycja w budżecie: droższe są zaprojektowanie scenariuszy, podłączenie systemów i testy na prawdziwych nagraniach. Dlatego trzymaj się rozsądnej kolejności: najpierw policz minuty i scenariusze, potem porównaj z kosztem nieodebranych telefonów, a dopiero na końcu wybierz wariant modelu.

Voice agent w firmie usługowej: 4 zastosowania

Głos ma sens tam, gdzie klient i tak by zadzwonił, a sprawa jest powtarzalna. Cztery scenariusze poniżej działają już dziś, bo nie wymagają od modelu ryzykownych decyzji. Jeśli chcesz zgłębić temat telefonów, przeczytaj o tym, jak działa wirtualny asystent połączeń.

Odbieranie telefonów poza godzinami

Warsztat, klinika czy serwis instalacji tracą najwięcej na telefonach po 17:00 i w weekendy. Agent głosowy odbiera każde połączenie, zapisuje sprawę i obiecuje kontakt zwrotny o konkretnej godzinie, a rano zespół dostaje listę z podsumowaniami. Zobacz, jak taki agent telefoniczny w warsztacie układa dzień pracy mechaników.

Wstępna kwalifikacja zapytania

Zanim człowiek oddzwoni, agent zbiera komplet informacji: imię, numer telefonu, adres, opis usterki i preferowany termin. Dzwoniący opowiada sprawę raz, a pracownik oddzwania raz, z gotową notatką zamiast pustej kartki. Warunek powodzenia jest jeden: lista pytań musi być krótka, pięć do siedmiu pozycji, bo dłuższy wywiad przez telefon męczy obie strony.

Umawianie wizyt i przypomnienia

Agent sprawdza wolne terminy, proponuje dwa do wyboru i zapisuje wizytę, a dzień wcześniej dzwoni z przypomnieniem. Kliniki i warsztaty odzyskują w ten sposób wizyty, które przepadały przez nieodebrane telefony. Ustal z góry, co ma się stać przy pełnym grafiku: zapis na listę rezerwową czy przekierowanie do człowieka.

Zanim wdrożysz agenta głosowego, przejdź przez krótką checklistę: 1) spisz 5-7 pytań kwalifikacyjnych; 2) przygotuj zasady przekazywania rozmowy do człowieka; 3) podłącz kalendarz lub prosty arkusz; 4) nagraj 10 prawdziwych rozmów do testów; 5) ustaw nagrywanie i klauzulę RODO.

Ryzyka i limity: o czym pamiętać

Błędy i granica 35,1%

Wynik 35,1% w bankowym teście tau-Voice to sygnał ostrzegawczy: model myli się w operacjach na pieniądzach, uprawnieniach i danych wrażliwych. Zasada praktyczna brzmi: agent głosowy zbiera informacje i umawia, ale nie autoryzuje płatności ani nie zmienia umów. Każdą rozmowę nagrywaj i losowo odsłuchuj kilka procent, bo błąd usłyszysz szybciej niż znajdziesz go w logach.

RODO i AI Act

Nagrania rozmów to dane osobowe, więc potrzebujesz podstawy prawnej, klauzuli informacyjnej i umowy powierzenia z dostawcą modelu. Od 2 sierpnia 2026 art. 50 unijnego AI Act wymaga też, by rozmówca wiedział, że mówi z AI, dlatego każda rozmowa powinna zaczynać się od jasnej zapowiedzi. Więcej o obowiązkach znajdziesz w tekście o RODO przy asystencie AI.

Jeśli rozważasz głos łudząco podobny do czyjegoś, sprawdź najpierw, jak działa klonowanie głosu i kiedy wymaga zgody.

Kiedy czat tekstowy wystarczy

Nie każda firma potrzebuje głosu. Czat tekstowy na stronie wygrywa, gdy klient woli pisać po cichu, sprawa wymaga załączników albo zespół chce odpowiadać między innymi zadaniami. Wdrożenie czata też jest tańsze i szybsze: prosta konfiguracja startuje od 1 200 zł, a całość trwa od 1 do 3 tygodni. Głos dokładaj wtedy, gdy telefony rwą dzień pracy, a nie dlatego, że to modne.

Najczęstsze pytania

Co to jest Gemini 3.8 Live?

Gemini 3.8 Live to model Google do rozmów głosowych w czasie rzeczywistym, pokazany 15 września 2026. Słucha, rozumuje i odpowiada głosem bez rozłączania, obsługuje 97 języków i potrafi wywoływać narzędzia, na przykład kalendarz, w trakcie rozmowy. Dostępny jest przez Live API, AI Studio i aplikację Gemini.

Czym różni się od zwykłego asystenta głosowego?

Klasyczny bot działa w trzech krokach z pauzami: mowa na tekst, odpowiedź, tekst na mowę. Gemini 3.8 Live przetwarza dźwięk bezpośrednio i rozumuje równolegle z mówieniem, więc dopuszcza przerywanie, pamięta kontekst i sięga po narzędzia w tle. Rozmowa brzmi dzięki temu jak dialog, a nie jak menu z cyframi.

Czy Gemini 3.8 Live mówi po polsku?

Tak, polski jest wśród 97 obsługiwanych języków i należy do dobrze wspieranych. Model radzi sobie z odmianą i naturalnymi wtrąceniami, ale przed wdrożeniem przetestuj nazwiska, nazwy ulic i liczby z jednostkami. Bazę wiedzy o firmie pisz prostymi zdaniami, bo asystent czyta ją na głos dosłownie.

Ile kosztuje Gemini 3.8 Live dla firmy?

Sam model kosztuje 0,005 USD za minutę wejścia i 0,018 USD za minutę wyjścia, czyli około 0,023 USD za minutę rozmowy. Wariant Extended Thinking to około 3,50 USD za godzinę wejścia. Do tego dolicz wdrożenie, integrację z kalendarzem lub CRM oraz testy, bo model to najmniejsza pozycja w budżecie.

Czy voice agent zastąpi recepcjonistkę?

Nie, przynajmniej nie w firmie usługowej. Agent głosowy dobrze odbiera telefony poza godzinami, zbiera dane i umawia wizyty, ale trudne rozmowy, reklamacje i decyzje zostają przy człowieku. Najlepszy układ to podział: maszyna pilnuje każdego telefonu, a człowiek przejmuje sprawy wymagające oceny i empatii.

Czy rozmowy głosowe AI są zgodne z RODO?

Mogą być, jeśli spełnisz obowiązki: podstawa prawna przetwarzania, klauzula dla dzwoniącego, umowa powierzenia z dostawcą i limit przechowywania nagrań. Od 2 sierpnia 2026 AI Act wymaga też ujawnienia, że rozmówcą jest AI. Każdą rozmowę zaczynaj więc od zapowiedzi i spisz zasady przed wdrożeniem.

Wniosek: czy to dla Ciebie

Gemini 3.8 Live odpowiada na pytanie z tytułu: asystent, który rozumuje na żywo, prowadzi płynną rozmowę po polsku, sięga po narzędzia w tle i kosztuje grosze za minutę, ale w zadaniach z pieniędzmi ufać mu jeszcze nie wolno. Jeśli Twoja firma gubi telefony poza godzinami, przetestuj voice agenta na jednym scenariuszu, na przykład umawianiu wizyt. Zacznij od policzenia minut i spisania pytań, a resztę poukładasz w pilotażu.

Nie wiesz, czy najpierw głos, czy czat tekstowy? Opisz jedno powtarzalne zadanie z telefonów i odbierz bezpłatną diagnozę procesu w 48 godzin: napisz przez formularz na czatowy.pl/kontakt.

Chcesz sprawdzić, ile to kosztuje u Ciebie?

Opisz jedno zadanie, które robicie ręcznie. Odeślę konkretną kalkulację.