Alicja: agent głosowy AI.
Alicja rozmawia głosem z odwiedzającymi aiadvisors.pl po polsku i po angielsku. Odpowiada na pytania o usługi i projekty, ocenia zapytanie i umawia spotkanie w kalendarzu. Rozmowę prowadzą dwa modele AI, a logika biznesowa i integracje działają w n8n.
- Branża
- Produkt własny / obsługa klienta
- Czas trwania
- wrzesień 2026
- Rezultat
- PL i EN · pytania, kwalifikacja i rezerwacja w jednej rozmowie
Problem
Formularz kontaktowy i link do kalendarza mają ten sam kłopot: nie odpowiadają na pytania. Kto chciał się dowiedzieć, czy wdrażam agentów głosowych albo od jakiej kwoty zaczyna się pierwszy projekt, musiał umówić spotkanie. Część rozmów, które prowadziłem, już po kilku minutach pokazywała, że firma nie jest jeszcze gotowa na projekt.
Chciałem też sprawdzić na sobie to, co wdrażam klientom: agenta głosowego, który korzysta z prawdziwych systemów: bazy wiedzy, kalendarza i poczty.
Co zbudowałem
Alicja jest w prawym dolnym rogu każdej strony aiadvisors.pl, także tej. Wystarczy ją kliknąć, żeby zacząć rozmowę przez mikrofon. Rozmowa trwa dalej, gdy rozmówca przechodzi na inną stronę serwisu.
- Dwa modele zamiast jednego. Rozmowę prowadzi model głosowy GPT-Live. Gdy trzeba sięgnąć po wiedzę, ocenić zapytanie albo wywołać narzędzie, sprawę przejmuje w tle model rozumujący GPT-5.6 Terra. Oba działają w Microsoft Azure, w regionie France Central.
- Własny gateway głosowy. Zarządza sesją, trzyma klucze, wykonuje narzędzia i pilnuje limitów: długości rozmowy, liczby rozmów z jednego adresu i dziennego budżetu minut. Przeglądarka przesyła tylko dźwięk i nie może wydawać modelowi poleceń. Gateway rozwijam jako własny komponent, od którego zaczynam wdrożenia u klientów, także telefoniczne.
- Logika biznesowa w n8n. Kilkanaście workflowów: konfiguracja agenta, router narzędzi, wiedza, kwalifikacja, wolne terminy, rezerwacja, research firmy, podsumowanie po rozmowie i usuwanie starych danych. Instrukcje i wiedzę zmieniam w n8n, bez wdrażania kodu.
- Wiedza z tej strony. Skrypt przenosi case studies i przewodniki do bazy w n8n. Na starcie rozmowy agent dostaje spis treści, a szczegóły pobiera dopiero wtedy, gdy rozmówca o nie zapyta.
- Kwalifikacja na dwóch skalach. Agent ocenia, czy firma wie, co chce zrobić, i czy jest gotowa podjąć decyzję. Terminy proponuje tylko przy wysokiej ocenie na obu skalach. Rozmówcę z firmy, która nie jest jeszcze gotowa, prosi o e-mail i zapowiada, że się odezwę.
- Rezerwację sprawdza n8n, nie model. Zanim powstanie spotkanie, n8n sprawdza ocenę zapytania, firmowy adres e-mail i to, czy termin jest nadal wolny. Rozmówca nie namówi modelu na rezerwację.
- Kontakt przez formularz, nie przez model. Imię i e-mail rozmówca wpisuje w formularzu na ekranie, a dane trafiają do gatewaya z pominięciem modelu. Adres e-mail dyktowany głosem to loteria rozpoznawania mowy.
- Research firmy w tle. Gdy padnie nazwa firmy, n8n sprawdza ją w publicznych źródłach i dopisuje wynik do kontekstu modelu. Agent go nie recytuje, tylko zadaje lepsze pytania. Szukam wyłącznie informacji o firmie, nigdy o osobie.
- Po rozmowie z potencjalnym klientem n8n zapisuje sesję i wysyła mi mail z podsumowaniem, oceną, cytatami, które ją uzasadniają, i umówionym terminem. Transkrypcje są usuwane po 30 dniach, dane zapytań po 12 miesiącach.
Niespodziewany problem: cisza
Najpoważniejszy kłopot nie wyszedł w testach automatycznych, tylko w rozmowach z ludźmi. W co trzeciej rozmowie testowej agent w którymś momencie milkł, a rozmówca pytał, czy ktoś tam jest. Zbudowałem przeciw temu cztery zabezpieczenia, między innymi strażnika ciszy i wcześniejsze pobieranie terminów z kalendarza. Żadne nie pomogło.
Pomogła zmiana podziału pracy między modelami. Na początku większość rozmowy przechodziła przez model rozumujący, a model głosowy wypowiadał jego odpowiedzi. Każda wypowiedź czekała więc na model w tle: w medianie 3,6 sekundy, a co dziesiąta ponad 8 sekund. Teraz zwykłą rozmowę prowadzi model głosowy, a model w tle dostaje tylko to, co wymaga wiedzy, narzędzi albo decyzji. Przy okazji instrukcje skróciły się o jedną czwartą. Ten podział stosuję w każdym kolejnym agencie.
Czego jeszcze się nauczyłem
- Sam zakaz szkodzi. Gdy zakazałem modelowi pewnych początków zdań, pojawiały się częściej: w 5,3% wypowiedzi zamiast 0,4%. Zakaz z podanym zamiennikiem zadziałał: zbędne „przekazuję” spadło z 2,0% do 0,6%.
- Model głosowy może wypowiedzieć wszystko, co napisze model w tle. Tekst delegacji trafia do rozmowy dosłownie, więc instrukcje dla modelu w tle piszę tak, jakby każde jego zdanie miało zostać wypowiedziane.
- Nazwy trzeba zapisać fonetycznie. Po polsku Alicja mówi „EjAj Adwajzors”, „enejten” i „emsipi”, bo tak te nazwy zapisałem w instrukcjach.
- Research po domenie potrafi przypisać cudzą firmę. Dlatego nazwę firmy w zapisie zapytania biorę ze słów rozmówcy, a nie z wyników wyszukiwania.
- Model chciał sam potwierdzać rezerwacje. Potwierdzenie pochodzi wyłącznie z wyniku n8n i pojawia się też na ekranie jako karta ze szczegółami spotkania.
Rezultat
Alicja działa na aiadvisors.pl od września 2026, w polskiej i angielskiej wersji strony. Odpowiada na pytania o usługi i projekty, ocenia zapytanie i umawia 30-minutowe spotkanie w kalendarzu. Po każdej rozmowie z potencjalnym klientem dostaję mail z podsumowaniem. Gateway ma ponad 270 testów automatycznych, a limity rozmów i budżet minut chronią przed nadużyciem.
Od tego samego gatewaya i tych samych wzorców n8n zaczynam agentów, których buduję dla klientów: z telefonem zamiast przeglądarki, z CRM klienta zamiast mojej skrzynki i w językach, w których dzwonią jego klienci. Szczegóły są na stronie Agenci głosowi AI dla obsługi klienta.