Saltar al contenido principal

IA

Por qué su agente de IA de cara al cliente necesita un modelo de respaldo

Un proveedor de modelos tiene una mala hora y su agente de WhatsApp se queda en silencio mientras los clientes esperan. Un modelo de respaldo es el seguro más barato contra eso. Así funciona el respaldo, cómo elegir uno y cómo encaja con los modelos rápidos y los presupuestos.

Equipo de MonoChat Actualizado: 7 min de lectura

En esta página
  1. Por qué los fallos de los modelos duelen más en las conversaciones con clientes
  2. Qué puede salir mal
  3. Cómo funciona el respaldo en un agente
  4. Cómo elegir un modelo de respaldo
  5. El modelo rápido: la otra mitad de la fiabilidad
  6. Presupuestos: la red de seguridad bajo la red de seguridad
  7. Respaldo no es traspaso
  8. Una lista de comprobación sencilla
  9. Configúrelo una vez, para todos los canales

Un agente de IA de cara al cliente necesita un modelo de respaldo porque todos los modelos acaban fallando en el peor momento: el proveedor sufre una caída, su cuenta alcanza un límite de uso, una solicitud agota el tiempo de espera o una conversación inusual consume más tokens de los previstos. Sin respaldo, el agente se queda en silencio y el cliente espera. Con él, un segundo modelo toma el relevo y la conversación continúa. En el Agent Harness de MonoChat, cada nodo AI Agent tiene un modelo principal, un modelo de respaldo y un modelo rápido, además de un límite de presupuesto por ejecución.

Este artículo explica por qué los fallos de los modelos importan más en la mensajería con clientes que en cualquier otro ámbito, cómo funciona el respaldo, cómo elegir un modelo de respaldo y cómo encaja con los modelos rápidos, los presupuestos y el traspaso a una persona.

Por qué los fallos de los modelos duelen más en las conversaciones con clientes

En una herramienta interna, una solicitud de IA fallida es una molestia: se pulsa reintentar. En una conversación con un cliente por WhatsApp, es una promesa rota. El cliente hizo una pregunta, vio el doble check azul y está esperando una respuesta.

Varios factores hacen que la mensajería con clientes sea especialmente sensible:

  • Los clientes no reintentan. Escriben de nuevo, más frustrados, o se marchan.
  • El tráfico es irregular. Una campaña, un retraso en una entrega o unas rebajas pueden multiplicar las conversaciones en cuestión de minutos, que es justo cuando actúan los límites de uso.
  • Los agentes hacen muchas llamadas. Un agent harness ejecuta el modelo en un bucle, a menudo varias veces por cada mensaje del cliente. Una sola llamada fallida puede bloquear toda la ejecución.
  • El tiempo importa en WhatsApp. Las respuestas de formato libre solo se permiten dentro de las 24 horas posteriores al último mensaje del cliente. Un bloqueo largo puede dejar una respuesta fuera de la ventana, donde necesitaría una plantilla aprobada.

Nada de esto se debe a que un proveedor concreto sea poco fiable. Todos los proveedores tienen incidencias, mantenimientos y límites de capacidad. La única pregunta es si su agente tiene un plan para ellos.

Qué puede salir mal

Caídas del proveedor. Parciales o totales, cortas o largas. Incluso una disponibilidad mensual del 99,9 % admite más de 40 minutos de inactividad.

Límites de uso. Su cuenta puede permitir un cierto número de solicitudes o de tokens por minuto. Una hora con mucha actividad puede alcanzar ese techo aunque el proveedor esté funcionando bien.

Tiempos de espera y respuestas lentas. Un modelo que suele responder en dos segundos puede tardar veinte bajo carga. Para un cliente que mira su teléfono, parece que no ocurre nada.

Ejecuciones descontroladas. Un agente que entra en bucle con una solicitud confusa, o una conversación que no deja de crecer, puede consumir mucho más que una ejecución normal.

Cambios de modelo. Los proveedores actualizan y retiran modelos. Un comportamiento en el que confiaba puede cambiar con muy poco aviso.

Cómo funciona el respaldo en un agente

La idea es sencilla: cuando el modelo principal no puede terminar el trabajo, un segundo modelo toma el relevo. En MonoChat, el modelo de respaldo toma el relevo tras un límite flexible o cuando el modelo principal falla. La conversación, las herramientas y las instrucciones siguen siendo las mismas; solo cambia el modelo que hace el trabajo.

En cada nodo AI Agent trabajan juntos tres roles:

RolQué hace
Modelo principalRazona, decide y redacta las respuestas
Modelo de respaldoToma el relevo tras un límite flexible o un fallo
Modelo rápidoSe encarga del trabajo en segundo plano

Además de los roles, un límite de presupuesto por ejecución fija lo que puede gastar una sola conversación.

Cómo elegir un modelo de respaldo

Prefiera un proveedor distinto

Un respaldo del mismo proveedor le protege frente a un modelo que se comporta mal, pero no frente a una incidencia de todo el proveedor ni a un límite de uso de su cuenta con ese proveedor. Un modelo de un segundo proveedor cubre ambos casos. MonoChat le permite conectar varios proveedores mediante LLM personalizados, así que es una decisión de configuración, no un proyecto.

Que sea lo bastante bueno, no idéntico

El respaldo no tiene que ser el mejor modelo disponible. Tiene que seguir sus instrucciones, llamar correctamente a sus herramientas y redactar una respuesta decente. Pruébelo por sí solo con sus conversaciones reales, como si fuera el modelo principal, antes de depender de él.

Compruebe que maneja sus herramientas

Los agentes dependen de las llamadas a herramientas: consultar un pedido, comprobar un hueco, crear un ticket. Algunos modelos son mucho mejores que otros en las llamadas estructuradas a herramientas. Un respaldo que escribe textos preciosos pero llama mal a las herramientas es peor que no tener respaldo.

Tenga en cuenta los idiomas que atiende

Si sus clientes escriben en turco, árabe o español, asegúrese de que el respaldo escribe esos idiomas tan bien como el modelo principal. Un cambio repentino de calidad o de tono se nota.

Considere el coste en ambas direcciones

Un respaldo más barato reduce el coste de las ejecuciones largas o inusuales que superan un límite flexible. Un respaldo más caro puede estar bien si solo gestiona fallos poco frecuentes. Decida qué trabajo quiere que haga el respaldo.

El modelo rápido: la otra mitad de la fiabilidad

No todos los pasos necesitan su mejor modelo. El trabajo en segundo plano, las tareas que rodean a la conversación y no la respuesta en sí, puede ejecutarse en un modelo más pequeño y rápido. Así se reservan la capacidad y el presupuesto del modelo principal para lo que el cliente realmente ve, y se reduce la probabilidad de alcanzar un límite de uso del modelo principal en las horas de más actividad.

En la práctica: ponga su modelo de razonamiento más potente como principal, un modelo sólido de un segundo proveedor como respaldo y un modelo rápido y económico para el trabajo en segundo plano.

Presupuestos: la red de seguridad bajo la red de seguridad

El respaldo mantiene al agente trabajando. Los presupuestos lo mantienen asequible. Un límite de presupuesto por ejecución significa que ninguna conversación, por extraña que sea, puede gastar más de lo que usted había previsto. Combinado con un límite flexible a partir del cual toma el relevo el respaldo, se obtiene un patrón predecible: las conversaciones normales se ejecutan en el modelo principal, las largas continúan en el respaldo y nada se descontrola.

Con sus propias claves de proveedor, MonoChat no añade ningún recargo por la IA, así que lo que presupuesta es lo que cobran sus proveedores.

Respaldo no es traspaso

Es tentador tratar un modelo de respaldo como la respuesta a todos los problemas. No lo es. Un respaldo resuelve fallos técnicos: el modelo está caído, va lento o se ha quedado sin presupuesto. El traspaso resuelve problemas de criterio: una reclamación, una consulta legal, un reembolso por encima de su límite o un cliente que simplemente pide hablar con una persona.

En MonoChat, el agente se ejecuta dentro de un flujo, de modo que el traspaso a su bandeja de entrada de equipo compartida con todo el historial siempre está disponible. WhatsApp también espera que las respuestas automáticas ofrezcan una vía clara hacia una persona. Diseñe ambos caminos:

  1. El modelo principal falla o alcanza un límite flexible → el modelo de respaldo continúa.
  2. El caso necesita a una persona → traspaso al equipo adecuado con el historial de la conversación.
  3. Fallan ambos → el flujo informa al cliente de que una persona le responderá y dirige la conversación a la bandeja de entrada.

Una lista de comprobación sencilla

  • Modelo principal elegido por su calidad con sus conversaciones reales.
  • Modelo de respaldo de un segundo proveedor, probado por sí solo con sus herramientas e idiomas.
  • Modelo rápido para el trabajo en segundo plano.
  • Límite de presupuesto por ejecución que corresponda al coste de su conversación normal con cierto margen.
  • Reglas de traspaso claras en las instrucciones del agente y en el flujo.
  • Una revisión de una muestra de conversaciones tras la primera semana, incluidas las que se ejecutaron en el respaldo.

Configúrelo una vez, para todos los canales

Como el nodo AI Agent vive en un flujo de MonoChat, los mismos modelos principal, de respaldo y rápido protegen a su agente en WhatsApp, Instagram, Messenger, TikTok, Telegram, chat web, SMS y voz. Y como Agent Harness le permite elegir el framework, el mismo enfoque funciona tanto si su agente se ejecuta en el harness integrado de MonoChat, en Claude Agent SDK, en OpenAI Agents SDK, en Pi o en su propio framework.

Descubra cómo encajan los roles de modelo en la página de Agent Harness.

Preguntas frecuentes

Preguntas frecuentes

¿Qué es un modelo de respaldo en un agente de IA?

Un modelo de respaldo es un segundo modelo que toma el relevo cuando el modelo principal no puede terminar el trabajo, por ejemplo porque el proveedor devuelve errores, se alcanza un límite de uso o se llega a un límite flexible de la ejecución. Mantiene la conversación en marcha en lugar de dejar al cliente sin respuesta.

¿Debe el modelo de respaldo venir de un proveedor distinto?

A menudo, sí. Un respaldo del mismo proveedor protege frente a problemas de un modelo concreto, pero no frente a una caída de todo el proveedor ni a un límite de uso de su cuenta. Un modelo de un segundo proveedor cubre ambos casos, siempre que sea lo bastante bueno para el trabajo de su agente.

¿Qué diferencia hay entre un modelo de respaldo y un modelo rápido?

El modelo de respaldo sustituye al modelo principal cuando este falla o alcanza un límite flexible. El modelo rápido funciona en paralelo y se encarga del trabajo en segundo plano, para que el modelo principal pueda centrarse en la conversación. En MonoChat, cada nodo AI Agent tiene un modelo principal, uno de respaldo y uno rápido.

¿Sustituye un modelo de respaldo al traspaso a una persona?

No. Un respaldo mantiene al agente trabajando cuando un modelo falla. El traspaso lleva la conversación a una persona cuando el agente no debería gestionarla. Una buena configuración tiene ambos: respaldo para los fallos técnicos y traspaso para los casos que requieren criterio.

¿Cómo se relacionan los límites de presupuesto con los modelos de respaldo?

Un límite de presupuesto fija lo que puede gastar una ejecución. En MonoChat, el modelo de respaldo puede tomar el relevo tras un límite flexible, de modo que una conversación larga o inusual puede continuar con otro modelo en lugar de detenerse o disparar los costes del principal.

Primer mes de Growth gratis

Gestione WhatsApp, Instagram y Messenger desde una sola bandeja de entrada

Empiece gratis con MonoChat: bandeja de entrada de equipo compartida, asistentes de IA, plantillas y campañas sobre las API oficiales de Meta.

Un código por empresa • 30 días para canjearlo • Sin tarjeta

150 $ para empezar.

Reclamar