AI
Dlaczego Twój agent AI obsługujący klientów potrzebuje modelu zapasowego
Dostawca modelu ma zły kwadrans, a Twój agent na WhatsApp milknie, gdy klienci czekają. Model zapasowy to najtańsze ubezpieczenie przed taką sytuacją. Oto jak działa model zapasowy, jak go wybrać i jak współgra z modelami szybkimi oraz budżetami.
Zespół MonoChat Zaktualizowano: 5 min czytania
Na tej stronie
- Dlaczego awarie modeli bardziej szkodzą w rozmowach z klientami
- Co może pójść nie tak
- Jak działa model zapasowy w agencie
- Jak wybrać model zapasowy
- Model szybki: druga połowa niezawodności
- Budżety: siatka bezpieczeństwa pod siatką bezpieczeństwa
- Model zapasowy to nie przekazanie rozmowy
- Prosta lista kontrolna
- Skonfiguruj raz, dla każdego kanału
Agent AI obsługujący klientów potrzebuje modelu zapasowego, ponieważ każdy model prędzej czy później zawodzi w najgorszym możliwym momencie: dostawca ma awarię, Twoje konto osiąga limit zapytań, zapytanie przekracza czas oczekiwania albo jedna nietypowa rozmowa zużywa więcej tokenów, niż planowano. Bez modelu zapasowego agent milknie, a klient czeka. Z nim drugi model przejmuje zadanie i rozmowa trwa dalej. W Agent Harness MonoChat każdy węzeł Agent AI ma model główny, model zapasowy i model szybki oraz limit budżetu na jedno uruchomienie.
Ten artykuł wyjaśnia, dlaczego awarie modeli mają większe znaczenie w komunikacji z klientami niż gdziekolwiek indziej, jak działa model zapasowy, jak go wybrać i jak współgra z modelami szybkimi, budżetami oraz przekazywaniem rozmów człowiekowi.
Dlaczego awarie modeli bardziej szkodzą w rozmowach z klientami
W narzędziu wewnętrznym nieudane zapytanie do AI to uciążliwość: klikasz ponów. W rozmowie z klientem na WhatsApp to złamana obietnica. Klient o coś zapytał, zobaczył niebieskie ptaszki i czeka na odpowiedź.
Kilka rzeczy sprawia, że komunikacja z klientami jest szczególnie wrażliwa:
- Klienci nie ponawiają. Piszą ponownie, bardziej sfrustrowani, albo odchodzą.
- Ruch jest nierówny. Kampania, opóźnienie dostawy lub wyprzedaż mogą w kilka minut zwielokrotnić liczbę rozmów, a wtedy właśnie dają o sobie znać limity zapytań.
- Agenci wykonują wiele wywołań. Agent harness uruchamia model w pętli, często kilka razy na jedną wiadomość klienta. Jedno nieudane wywołanie może zatrzymać całe uruchomienie.
- Na WhatsApp liczy się czas. Odpowiedzi w dowolnej formie są dozwolone tylko w ciągu 24 godzin od ostatniej wiadomości klienta. Długie zawieszenie może przesunąć odpowiedź poza to okno, gdzie potrzebny byłby zatwierdzony szablon.
Nie chodzi o to, że jakiś konkretny dostawca jest zawodny. Każdy dostawca ma incydenty, prace serwisowe i limity pojemności. Pytanie brzmi tylko, czy Twój agent ma na to plan.
Co może pójść nie tak
Awarie dostawcy. Częściowe lub całkowite, krótkie lub długie. Nawet miesięczna dostępność na poziomie 99,9% dopuszcza ponad 40 minut przestoju.
Limity zapytań. Twoje konto może zezwalać na określoną liczbę zapytań lub tokenów na minutę. Pracowita godzina może osiągnąć ten pułap, nawet gdy sam dostawca działa bez zarzutu.
Przekroczenia czasu i wolne odpowiedzi. Model, który zwykle odpowiada w dwie sekundy, pod obciążeniem może potrzebować dwudziestu. Dla klienta na telefonie wygląda to tak, jakby nic się nie działo.
Wymykające się uruchomienia. Agent, który zapętla się przy niejasnej prośbie, albo rozmowa, która stale się wydłuża, mogą zużyć znacznie więcej niż zwykłe uruchomienie.
Zmiany modeli. Dostawcy aktualizują i wycofują modele. Zachowanie, na którym polegasz, może się zmienić z niewielkim wyprzedzeniem.
Jak działa model zapasowy w agencie
Idea jest prosta: gdy model główny nie może dokończyć zadania, przejmuje je drugi model. W MonoChat model zapasowy przejmuje zadanie po przekroczeniu miękkiego limitu lub gdy model główny zawiedzie. Rozmowa, narzędzia i instrukcje pozostają te same; zmienia się tylko model wykonujący pracę.
W każdym węźle Agent AI współpracują trzy role:
| Rola | Co robi |
|---|---|
| Model główny | Analizuje, podejmuje decyzje i pisze odpowiedzi |
| Model zapasowy | Przejmuje zadanie po przekroczeniu miękkiego limitu lub awarii |
| Model szybki | Obsługuje zadania w tle |
Oprócz ról działa limit budżetu na jedno uruchomienie, który ogranicza, ile może kosztować pojedyncza rozmowa.
Jak wybrać model zapasowy
Wybierz innego dostawcę
Model zapasowy od tego samego dostawcy chroni przed nieprawidłowym działaniem jednego modelu, ale nie przed incydentem po stronie całego dostawcy ani limitem zapytań na Twoim koncie u tego dostawcy. Model od drugiego dostawcy chroni przed jednym i drugim. MonoChat pozwala połączyć kilku dostawców przez niestandardowe LLM, więc to kwestia konfiguracji, a nie projekt.
Niech będzie wystarczająco dobry, a nie identyczny
Model zapasowy nie musi być najlepszym dostępnym modelem. Musi przestrzegać Twoich instrukcji, poprawnie wywoływać narzędzia i pisać przyzwoite odpowiedzi. Przetestuj go na swoich prawdziwych rozmowach samodzielnie, tak jakby był modelem głównym, zanim zaczniesz na nim polegać.
Sprawdź, czy radzi sobie z Twoimi narzędziami
Agenci zależą od wywołań narzędzi: sprawdzenia zamówienia, dostępności terminu, utworzenia zgłoszenia. Niektóre modele radzą sobie ze zdefiniowanymi wywołaniami narzędzi znacznie lepiej niż inne. Model zapasowy, który pisze piękne teksty, ale błędnie wywołuje narzędzia, jest gorszy niż brak modelu zapasowego.
Zwróć uwagę na języki, w których obsługujesz klientów
Jeśli Twoi klienci piszą po turecku, arabsku lub hiszpańsku, upewnij się, że model zapasowy pisze w tych językach równie dobrze jak model główny. Nagła zmiana jakości lub tonu jest zauważalna.
Rozważ koszt w obu kierunkach
Tańszy model zapasowy obniża koszt długich lub nietypowych uruchomień, które przekraczają miękki limit. Droższy model zapasowy może być w porządku, jeśli obsługuje tylko rzadkie awarie. Zdecyduj, jaką rolę ma pełnić model zapasowy.
Model szybki: druga połowa niezawodności
Nie każdy krok wymaga Twojego najlepszego modelu. Zadania w tle, czyli prace wokół rozmowy, a nie sama odpowiedź, mogą działać na mniejszym, szybszym modelu. Dzięki temu pojemność i budżet modelu głównego są zachowane dla tego, co klient faktycznie widzi, a ryzyko osiągnięcia limitu zapytań na modelu głównym w godzinach szczytu maleje.
W praktyce: ustaw jako główny swój najlepszy model do rozumowania, jako zapasowy solidny model od drugiego dostawcy, a do zadań w tle szybki i niedrogi model.
Budżety: siatka bezpieczeństwa pod siatką bezpieczeństwa
Model zapasowy sprawia, że agent działa dalej. Budżety sprawiają, że pozostaje to opłacalne. Limit budżetu na jedno uruchomienie oznacza, że żadna pojedyncza rozmowa, choćby najdziwniejsza, nie może kosztować więcej, niż zaplanowałeś. W połączeniu z miękkim limitem, po którym przejmuje model zapasowy, otrzymujesz przewidywalny wzorzec: zwykłe rozmowy działają na modelu głównym, długie kontynuowane są na zapasowym, a nic się nie wymyka spod kontroli.
Przy własnych kluczach dostawców MonoChat nie dolicza marży na AI, więc to, co zaplanujesz w budżecie, jest tym, co pobiorą Twoi dostawcy.
Model zapasowy to nie przekazanie rozmowy
Kuszące jest traktowanie modelu zapasowego jako odpowiedzi na każdy problem. Tak nie jest. Model zapasowy rozwiązuje awarie techniczne: model nie działa, jest wolny lub wyczerpał budżet. Przekazanie rozmowy rozwiązuje problemy wymagające osądu: reklamację, pytanie prawne, zwrot powyżej Twojego limitu albo klienta, który po prostu prosi o człowieka.
W MonoChat agent działa w przepływie, więc przekazanie do wspólnej skrzynki zespołu z pełną historią jest zawsze dostępne. WhatsApp oczekuje też, że automatyczne odpowiedzi oferują wyraźną drogę do człowieka. Zaprojektuj obie ścieżki:
- Model główny zawodzi lub osiąga miękki limit → rozmowę kontynuuje model zapasowy.
- Sprawa wymaga człowieka → przekazanie właściwemu zespołowi wraz z historią rozmowy.
- Zawodzą oba → przepływ informuje klienta, że odpowie człowiek, i kieruje rozmowę do skrzynki.
Prosta lista kontrolna
- Model główny wybrany pod kątem jakości na Twoich prawdziwych rozmowach.
- Model zapasowy od drugiego dostawcy, przetestowany samodzielnie z Twoimi narzędziami i językami.
- Model szybki do zadań w tle.
- Limit budżetu na uruchomienie odpowiadający kosztowi zwykłej rozmowy z pewnym zapasem.
- Jasne zasady przekazywania rozmów w instrukcjach agenta i w przepływie.
- Przegląd próbki rozmów po pierwszym tygodniu, w tym tych, które działały na modelu zapasowym.
Skonfiguruj raz, dla każdego kanału
Ponieważ węzeł Agent AI znajduje się w przepływie MonoChat, te same modele: główny, zapasowy i szybki, chronią Twojego agenta na WhatsApp, Instagramie, Messengerze, TikToku, Telegramie, czacie na stronie, w SMS-ach i na kanale głosowym. A ponieważ Agent Harness pozwala wybrać framework, to samo podejście działa niezależnie od tego, czy Twój agent działa na wbudowanym harnessie MonoChat, Claude Agent SDK, OpenAI Agents SDK, Pi czy Twoim własnym frameworku.
Zobacz, jak role modeli współgrają, na stronie Agent Harness.
Wdróż to w praktyce z MonoChat