AI
고객 응대 AI 에이전트에 폴백 모델이 필요한 이유
모델 제공업체에 문제가 생긴 한 시간 동안 WhatsApp 에이전트가 침묵하고 고객은 기다립니다. 폴백 모델은 이런 상황에 대비하는 가장 저렴한 보험입니다. 폴백이 작동하는 방식, 모델을 고르는 방법, 고속 모델·예산과 어떻게 함께 쓰는지 소개합니다.
MonoChat 팀 업데이트: 4 분 소요
이 페이지 내용
고객 응대 AI 에이전트에는 폴백 모델이 필요합니다. 어떤 모델이든 결국 가장 나쁜 순간에 실패하기 때문입니다. 제공업체에 장애가 생기고, 계정이 요청 한도에 도달하고, 요청이 시간 초과되고, 특이한 대화 하나가 계획보다 많은 토큰을 쓰기도 합니다. 폴백이 없으면 에이전트는 침묵하고 고객은 기다립니다. 폴백이 있으면 두 번째 모델이 이어받아 대화가 계속됩니다. MonoChat의 Agent Harness에서는 모든 AI 에이전트 노드에 메인 모델, 폴백 모델, 고속 모델과 실행당 예산 한도가 있습니다.
이 글에서는 고객 메시징에서 모델 실패가 다른 어떤 곳보다 중요한 이유, 폴백이 작동하는 방식, 폴백 모델을 고르는 방법, 그리고 고속 모델·예산·상담원 연결과 어떻게 함께 쓰는지 설명합니다.
고객 대화에서 모델 실패가 더 치명적인 이유
내부 도구에서 AI 요청이 실패하면 불편한 정도입니다. 다시 시도를 누르면 됩니다. 하지만 WhatsApp의 고객 대화에서는 약속이 깨진 것입니다. 고객은 질문을 보냈고, 읽음 표시를 확인했고, 답을 기다리고 있습니다.
고객 메시징을 특히 민감하게 만드는 요소는 다음과 같습니다.
- 고객은 재시도하지 않습니다. 더 짜증 난 채로 다시 쓰거나, 떠납니다.
- 트래픽이 들쭉날쭉합니다. 캠페인, 배송 지연, 세일이 있으면 몇 분 만에 대화가 몇 배로 늘 수 있고, 바로 이때 요청 한도에 걸립니다.
- 에이전트는 호출을 많이 합니다. 에이전트 하네스는 모델을 루프로 실행하며, 고객 메시지 하나에 여러 번 호출하는 경우도 많습니다. 호출 하나가 실패하면 실행 전체가 멈출 수 있습니다.
- WhatsApp에서는 시간이 중요합니다. 자유 형식 답변은 고객의 마지막 메시지 후 24시간 이내에만 허용됩니다. 지연이 길어지면 답변이 이 창을 벗어나 승인된 템플릿이 필요해질 수 있습니다.
이는 특정 제공업체가 불안정하다는 이야기가 아닙니다. 모든 제공업체에는 장애, 점검, 용량 한계가 있습니다. 문제는 내 에이전트에 이에 대한 대책이 있느냐는 것뿐입니다.
무엇이 잘못될 수 있나
제공업체 장애. 부분적이든 전체적이든, 짧든 길든 발생합니다. 월간 가용성 99.9%라 해도 40분이 넘는 다운타임이 허용됩니다.
요청 한도. 계정에서 분당 허용되는 요청 수나 토큰 수가 정해져 있을 수 있습니다. 제공업체가 정상이어도 바쁜 시간대에는 이 상한에 도달할 수 있습니다.
시간 초과와 느린 응답. 보통 2초 만에 답하던 모델이 부하가 걸리면 20초가 걸리기도 합니다. 휴대폰을 보는 고객에게는 아무 일도 일어나지 않는 것처럼 느껴집니다.
폭주하는 실행. 헷갈리는 요청에서 루프를 도는 에이전트나 계속 길어지는 대화는 평소 실행보다 훨씬 많은 비용을 쓸 수 있습니다.
모델 변경. 제공업체는 모델을 업데이트하고 종료합니다. 의존하던 동작이 거의 예고 없이 바뀔 수 있습니다.
에이전트에서 폴백이 작동하는 방식
원리는 단순합니다. 메인 모델이 작업을 끝낼 수 없을 때 두 번째 모델이 이어받습니다. MonoChat에서는 소프트 한도에 도달하거나 메인 모델이 실패하면 폴백 모델이 이어받습니다. 대화, 도구, 지침은 그대로이고 작업을 수행하는 모델만 바뀝니다.
각 AI 에이전트 노드에서는 세 가지 역할이 함께 작동합니다.
| 역할 | 하는 일 |
|---|---|
| 메인 모델 | 추론하고, 판단하고, 답변을 작성합니다 |
| 폴백 모델 | 소프트 한도에 도달하거나 실패하면 이어받습니다 |
| 고속 모델 | 백그라운드 작업을 처리합니다 |
이 역할 위에 실행당 예산 한도가 있어 한 번의 대화가 쓸 수 있는 비용을 제한합니다.
폴백 모델을 고르는 방법
다른 제공업체를 권장합니다
같은 제공업체의 폴백은 특정 모델이 제대로 작동하지 않는 상황은 막아 주지만, 제공업체 전체 장애나 해당 제공업체 계정의 요청 한도는 막지 못합니다. 두 번째 제공업체의 모델이라면 둘 다 대비할 수 있습니다. MonoChat에서는 커스텀 LLM으로 여러 제공업체를 연결할 수 있으므로, 프로젝트가 아니라 설정 하나로 해결됩니다.
동일할 필요는 없고, 충분히 좋으면 됩니다
폴백이 가장 뛰어난 모델일 필요는 없습니다. 지침을 따르고, 도구를 올바르게 호출하고, 무난한 답변을 쓸 수 있으면 됩니다. 의존하기 전에 실제 대화로 폴백 모델만 따로 메인 모델처럼 테스트해 보세요.
내 도구를 다룰 수 있는지 확인하세요
에이전트는 도구 호출에 의존합니다. 주문 조회, 예약 가능 시간 확인, 티켓 생성 같은 작업입니다. 구조화된 도구 호출은 모델마다 실력 차이가 큽니다. 글은 아름답게 쓰지만 도구를 잘못 호출하는 폴백은 없는 것보다 나쁩니다.
응대하는 언어를 살펴보세요
고객이 튀르키예어, 아랍어, 스페인어로 쓴다면 폴백도 메인 모델만큼 그 언어를 잘 쓰는지 확인하세요. 품질이나 어조가 갑자기 바뀌면 눈에 띕니다.
양쪽 방향의 비용을 고려하세요
더 저렴한 폴백은 소프트 한도를 넘어가는 길거나 특이한 실행의 비용을 줄여 줍니다. 더 비싼 폴백도 드문 실패만 처리한다면 괜찮을 수 있습니다. 폴백에 어떤 역할을 맡길지 정하세요.
고속 모델: 안정성의 나머지 절반
모든 단계에 최고 모델이 필요한 것은 아닙니다. 답변 자체가 아니라 대화를 둘러싼 백그라운드 작업은 더 작고 빠른 모델로 실행할 수 있습니다. 그러면 고객이 실제로 보는 부분을 위해 메인 모델의 처리 용량과 예산을 아끼고, 바쁜 시간대에 메인 모델이 요청 한도에 걸릴 가능성도 줄어듭니다.
실무에서는 가장 강력한 추론 모델을 메인으로, 두 번째 제공업체의 믿을 만한 모델을 폴백으로, 빠르고 저렴한 모델을 백그라운드 작업용으로 두세요.
예산: 안전망 아래의 안전망
폴백은 에이전트가 계속 작동하게 하고, 예산은 비용을 감당 가능하게 합니다. 실행당 예산 한도가 있으면 아무리 특이한 대화도 계획한 것 이상을 쓸 수 없습니다. 소프트 한도 이후 폴백이 이어받는 구조와 함께 쓰면 예측 가능한 패턴이 만들어집니다. 일반 대화는 메인 모델에서, 긴 대화는 폴백에서 이어지고, 비용이 폭주하는 일은 없습니다.
자체 제공업체 키를 사용하면 MonoChat은 AI 사용료에 추가 요금을 붙이지 않으므로, 예산으로 잡은 금액이 곧 제공업체가 청구하는 금액입니다.
폴백은 상담원 연결이 아닙니다
폴백 모델을 모든 문제의 해답으로 여기기 쉽지만 그렇지 않습니다. 폴백은 모델이 중단되었거나, 느리거나, 예산을 다 쓴 기술적 실패를 해결합니다. 상담원 연결은 판단이 필요한 문제를 해결합니다. 불만 제기, 법률 문의, 한도를 넘는 환불, 또는 단순히 사람을 요청하는 고객이 그렇습니다.
MonoChat에서는 에이전트가 플로우 안에서 실행되므로 전체 기록과 함께 공유 팀 인박스로 넘기는 상담원 연결을 언제든 사용할 수 있습니다. WhatsApp 역시 자동 응답에 사람으로 연결되는 명확한 경로가 있기를 기대합니다. 두 경로를 모두 설계하세요.
- 메인 모델이 실패하거나 소프트 한도에 도달 → 폴백 모델이 계속 진행합니다.
- 사람이 필요한 사례 → 대화 기록과 함께 적절한 팀에 상담원을 연결합니다.
- 둘 다 실패 → 플로우가 고객에게 담당자가 답변드린다고 안내하고 대화를 인박스로 전달합니다.
간단한 체크리스트
- 실제 대화에서의 품질을 기준으로 선택한 메인 모델.
- 두 번째 제공업체의 폴백 모델, 내 도구와 언어로 단독 테스트 완료.
- 백그라운드 작업용 고속 모델.
- 평소 대화 비용에 어느 정도 여유를 더한 실행당 예산 한도.
- 에이전트 지침과 플로우에 명확한 상담원 연결 규칙.
- 첫 주가 지난 뒤, 폴백으로 실행된 대화를 포함한 샘플 대화 검토.
한 번 설정하면 모든 채널에 적용됩니다
AI 에이전트 노드는 MonoChat 플로우에 있으므로, 같은 메인·폴백·고속 모델이 WhatsApp, Instagram, Messenger, TikTok, Telegram, 웹 채팅, SMS, 음성에서 에이전트를 보호합니다. 또 Agent Harness에서는 프레임워크를 선택할 수 있으므로, 에이전트가 MonoChat 기본 하네스, Claude Agent SDK, OpenAI Agents SDK, Pi, 또는 직접 만든 프레임워크 중 무엇으로 실행되든 같은 방식이 통합니다.
모델 역할이 어떻게 맞물리는지는 Agent Harness 페이지에서 확인하세요.
MonoChat으로 실행해 보세요