Vai al contenuto principale

IA

Perché il tuo agente IA a contatto con i clienti ha bisogno di un modello di fallback

Un provider di modelli ha un’ora difficile e il tuo agente WhatsApp resta muto mentre i clienti aspettano. Un modello di fallback è l’assicurazione più economica contro questo rischio. Ecco come funziona il fallback, come sceglierne uno e come si integra con i modelli veloci e i budget.

Team MonoChat Aggiornato: 7 min di lettura

In questa pagina
  1. Perché i guasti dei modelli fanno più danni nelle conversazioni con i clienti
  2. Cosa può andare storto
  3. Come funziona il fallback in un agente
  4. Come scegliere un modello di fallback
  5. Il modello veloce: l’altra metà dell’affidabilità
  6. Budget: la rete di sicurezza sotto la rete di sicurezza
  7. Il fallback non è il passaggio a un operatore
  8. Una semplice checklist
  9. Configuralo una volta, per ogni canale

Un agente IA a contatto con i clienti ha bisogno di un modello di fallback perché prima o poi ogni modello fallisce nel momento peggiore: il provider ha un’interruzione, il tuo account raggiunge un limite di frequenza, una richiesta va in timeout oppure una conversazione insolita consuma più token del previsto. Senza fallback l’agente resta muto e il cliente aspetta. Con un fallback, un secondo modello subentra e la conversazione prosegue. In Agent Harness di MonoChat, ogni nodo Agente IA ha un modello principale, un modello di fallback e un modello veloce, oltre a un limite di budget per esecuzione.

Questo articolo spiega perché i guasti dei modelli contano più nella messaggistica con i clienti che altrove, come funziona il fallback, come scegliere un modello di fallback e come si integra con modelli veloci, budget e passaggio a un operatore.

Perché i guasti dei modelli fanno più danni nelle conversazioni con i clienti

In uno strumento interno, una richiesta IA fallita è un fastidio: clicchi su riprova. In una conversazione con un cliente su WhatsApp è una promessa non mantenuta. Il cliente ha fatto una domanda, ha visto la doppia spunta blu e aspetta una risposta.

Alcuni fattori rendono la messaggistica con i clienti particolarmente delicata:

  • I clienti non riprovano. Scrivono di nuovo, più irritati, oppure se ne vanno.
  • Il traffico è a picchi. Una campagna, un ritardo nelle consegne o una promozione possono moltiplicare le conversazioni in pochi minuti, ed è proprio allora che i limiti di frequenza si fanno sentire.
  • Gli agenti fanno molte chiamate. Un agent harness esegue il modello in un ciclo, spesso più volte per ogni messaggio del cliente. Una sola chiamata fallita può bloccare l’intera esecuzione.
  • I tempi contano su WhatsApp. Le risposte libere sono consentite solo entro 24 ore dall’ultimo messaggio del cliente. Uno stallo prolungato può spingere una risposta fuori dalla finestra, dove servirebbe un template approvato.

Nulla di tutto questo dipende dal fatto che un provider in particolare sia inaffidabile. Ogni provider ha incidenti, manutenzioni e limiti di capacità. La questione è solo se il tuo agente ha un piano per affrontarli.

Cosa può andare storto

Interruzioni del provider. Parziali o totali, brevi o lunghe. Anche una disponibilità mensile del 99,9% ammette più di 40 minuti di inattività.

Limiti di frequenza. Il tuo account può consentire un certo numero di richieste o token al minuto. Un’ora di punta può raggiungere quel tetto anche quando il provider funziona regolarmente.

Timeout e risposte lente. Un modello che di solito risponde in due secondi può impiegarne venti sotto carico. Per un cliente al telefono è come se non succedesse nulla.

Esecuzioni fuori controllo. Un agente che va in loop su una richiesta confusa, o una conversazione che continua a crescere, può consumare molto più di un’esecuzione normale.

Cambi di modello. I provider aggiornano e ritirano i modelli. Un comportamento su cui contavi può cambiare con poco preavviso.

Come funziona il fallback in un agente

L’idea è semplice: quando il modello principale non riesce a portare a termine il lavoro, subentra un secondo modello. In MonoChat il modello di fallback subentra dopo un limite soft o quando il modello principale fallisce. La conversazione, gli strumenti e le istruzioni restano gli stessi; cambia solo il modello che svolge il lavoro.

In ogni nodo Agente IA collaborano tre ruoli:

RuoloCosa fa
Modello principaleRagiona, decide e scrive le risposte
Modello di fallbackSubentra dopo un limite soft o un guasto
Modello veloceGestisce il lavoro in background

Oltre ai ruoli, un limite di budget per esecuzione fissa un tetto a ciò che una singola conversazione può spendere.

Come scegliere un modello di fallback

Preferisci un provider diverso

Un fallback dello stesso provider ti protegge se un singolo modello si comporta male, ma non da un incidente dell’intero provider o da un limite di frequenza sul tuo account presso quel provider. Un modello di un secondo provider copre entrambi i casi. MonoChat ti permette di collegare più provider tramite gli LLM personalizzati, quindi è una scelta di configurazione, non un progetto.

Scegline uno abbastanza valido, non identico

Il fallback non deve essere il miglior modello disponibile. Deve seguire le tue istruzioni, chiamare correttamente i tuoi strumenti e scrivere una risposta dignitosa. Provalo da solo sulle tue conversazioni reali, come se fosse il modello principale, prima di affidarti a lui.

Verifica che gestisca i tuoi strumenti

Gli agenti dipendono dalle chiamate agli strumenti: cercare un ordine, controllare uno slot, creare un ticket. Alcuni modelli sono molto più bravi di altri nelle chiamate strutturate. Un fallback che scrive testi bellissimi ma chiama male gli strumenti è peggio di nessun fallback.

Considera le lingue che servi

Se i tuoi clienti scrivono in turco, arabo o spagnolo, assicurati che il fallback scriva quelle lingue bene quanto il modello principale. Un cambio improvviso di qualità o di tono si nota.

Valuta il costo in entrambe le direzioni

Un fallback più economico riduce il costo delle esecuzioni lunghe o insolite che superano un limite soft. Un fallback più costoso può andare bene se gestisce solo guasti rari. Decidi quale compito vuoi che svolga il fallback.

Il modello veloce: l’altra metà dell’affidabilità

Non ogni passaggio richiede il tuo modello migliore. Il lavoro in background, cioè le attività attorno alla conversazione e non la risposta in sé, può girare su un modello più piccolo e rapido. Così si riservano la capacità e il budget del modello principale a ciò che il cliente vede davvero, e si riduce la probabilità di raggiungere un limite di frequenza sul modello principale nelle ore di punta.

In pratica: usa il tuo modello di ragionamento più forte come principale, un modello solido di un secondo provider come fallback e un modello veloce ed economico per il lavoro in background.

Budget: la rete di sicurezza sotto la rete di sicurezza

Il fallback mantiene l’agente al lavoro. I budget lo mantengono sostenibile. Un limite di budget per esecuzione significa che nessuna conversazione, per quanto strana, può spendere più di quanto hai previsto. Combinato con un limite soft oltre il quale subentra il fallback, ottieni uno schema prevedibile: le conversazioni normali girano sul modello principale, quelle lunghe proseguono sul fallback e nulla sfugge di mano.

Con le chiavi dei tuoi provider, MonoChat non aggiunge alcun ricarico sull’IA, quindi ciò che metti a budget è ciò che i tuoi provider addebitano.

Il fallback non è il passaggio a un operatore

È facile considerare un modello di fallback la risposta a ogni problema. Non lo è. Un fallback risolve i guasti tecnici: il modello è fuori servizio, lento o senza budget. Il passaggio a un operatore risolve i problemi di discernimento: un reclamo, una questione legale, un rimborso oltre il tuo limite o un cliente che semplicemente chiede una persona.

In MonoChat l’agente gira all’interno di un flusso, quindi il passaggio all’inbox condivisa del tuo team con tutta la cronologia è sempre disponibile. WhatsApp si aspetta inoltre che le risposte automatiche offrano una via chiara verso una persona. Progetta entrambi i percorsi:

  1. Il modello principale fallisce o raggiunge un limite soft → il modello di fallback prosegue.
  2. Il caso richiede una persona → passaggio al team giusto con la cronologia della conversazione.
  3. Falliscono entrambi → il flusso dice al cliente che una persona risponderà e instrada la conversazione all’inbox.

Una semplice checklist

  • Modello principale scelto per qualità sulle tue conversazioni reali.
  • Modello di fallback di un secondo provider, provato da solo con i tuoi strumenti e le tue lingue.
  • Modello veloce per il lavoro in background.
  • Limite di budget per esecuzione in linea con il costo di una conversazione normale, con un certo margine.
  • Regole chiare di passaggio a un operatore nelle istruzioni dell’agente e nel flusso.
  • Una revisione di un campione di conversazioni dopo la prima settimana, comprese quelle gestite dal fallback.

Configuralo una volta, per ogni canale

Poiché il nodo Agente IA vive in un flusso MonoChat, gli stessi modelli principale, di fallback e veloce proteggono il tuo agente su WhatsApp, Instagram, Messenger, TikTok, Telegram, chat web, SMS e voce. E poiché Agent Harness ti permette di scegliere il framework, lo stesso approccio funziona sia che il tuo agente giri sull’harness integrato di MonoChat, su Claude Agent SDK, su OpenAI Agents SDK, su Pi o sul tuo framework.

Scopri come si combinano i ruoli dei modelli nella pagina Agent Harness.

FAQ

Domande frequenti

Che cos’è un modello di fallback in un agente IA?

Un modello di fallback è un secondo modello che subentra quando il modello principale non riesce a portare a termine il lavoro, ad esempio perché il provider restituisce errori, viene raggiunto un limite di frequenza o si arriva a un limite soft dell’esecuzione. Mantiene attiva la conversazione invece di lasciare il cliente senza risposta.

Il modello di fallback dovrebbe provenire da un provider diverso?

Spesso sì. Un fallback dello stesso provider protegge dai problemi di un singolo modello, ma non da un’interruzione dell’intero provider o da un limite di frequenza sul tuo account. Un modello di un secondo provider copre entrambi i casi, purché sia abbastanza valido per il compito del tuo agente.

Qual è la differenza tra un modello di fallback e un modello veloce?

Il modello di fallback sostituisce il modello principale quando questo fallisce o raggiunge un limite soft. Il modello veloce lavora in parallelo e gestisce il lavoro in background, così il modello principale può concentrarsi sulla conversazione. In MonoChat ogni nodo Agente IA ha un modello principale, uno di fallback e uno veloce.

Un modello di fallback sostituisce il passaggio a un operatore?

No. Il fallback mantiene l’agente al lavoro quando un modello fallisce. Il passaggio a un operatore sposta la conversazione a una persona quando l’agente non dovrebbe gestirla. Una buona configurazione prevede entrambi: fallback per i guasti tecnici, passaggio a un operatore per i casi che richiedono discernimento.

Che rapporto c’è tra i limiti di budget e i modelli di fallback?

Un limite di budget fissa un tetto a ciò che una singola esecuzione può spendere. In MonoChat il modello di fallback può subentrare dopo un limite soft, così una conversazione lunga o insolita può proseguire su un altro modello invece di interrompersi o far salire i costi sul modello principale.

Primo mese di Growth offerto da noi

Gestisca WhatsApp, Instagram e Messenger da un'unica inbox

Inizi gratis con MonoChat: inbox condivisa del team, assistenti IA, modelli di messaggio e campagne sulle API ufficiali di Meta.

Un codice per azienda • 30 giorni per riscattarlo • Nessuna carta richiesta

150 $ per iniziare.

Riscuoti