मुख्य कंटेंट पर जाएँ

AI

आपके ग्राहकों से बात करने वाले AI एजेंट को फ़ॉलबैक मॉडल क्यों चाहिए

किसी मॉडल प्रदाता का एक घंटा ख़राब जाता है और आपका WhatsApp एजेंट चुप हो जाता है, जबकि ग्राहक इंतज़ार करते हैं। फ़ॉलबैक मॉडल इसके ख़िलाफ़ सबसे सस्ता बीमा है। जानें फ़ॉलबैक कैसे काम करता है, उसे कैसे चुनें, और वह तेज़ मॉडल और बजट के साथ कैसे फ़िट होता है।

MonoChat टीम अपडेट किया गया: 7 मिनट में पढ़ें

इस पेज पर
  1. ग्राहकों की बातचीत में मॉडल की विफलताएँ ज़्यादा क्यों चुभती हैं
  2. क्या गड़बड़ हो सकती है
  3. एजेंट में फ़ॉलबैक कैसे काम करता है
  4. फ़ॉलबैक मॉडल कैसे चुनें
  5. तेज़ मॉडल: भरोसेमंदी का दूसरा हिस्सा
  6. बजट: सुरक्षा जाल के नीचे का सुरक्षा जाल
  7. फ़ॉलबैक हैंडओवर नहीं है
  8. एक सरल चेकलिस्ट
  9. एक बार सेट करें, हर चैनल के लिए

ग्राहकों से बात करने वाले AI एजेंट को फ़ॉलबैक मॉडल की ज़रूरत इसलिए होती है कि हर मॉडल कभी न कभी, सबसे बुरे वक़्त पर फ़ेल होता है: प्रदाता का आउटेज हो जाता है, आपका अकाउंट रेट लिमिट छू लेता है, कोई रिक्वेस्ट टाइम आउट हो जाती है, या कोई एक असामान्य बातचीत योजना से ज़्यादा टोकन खा जाती है। फ़ॉलबैक के बिना एजेंट चुप हो जाता है और ग्राहक इंतज़ार करता रहता है। फ़ॉलबैक के साथ दूसरा मॉडल कमान संभाल लेता है और बातचीत आगे बढ़ती रहती है। MonoChat के Agent Harness में हर AI एजेंट नोड में एक मुख्य मॉडल, एक फ़ॉलबैक मॉडल और एक तेज़ मॉडल होता है, साथ में हर रन के लिए बजट सीमा।

यह लेख बताता है कि कस्टमर मैसेजिंग में मॉडल की विफलताएँ बाकी जगहों से ज़्यादा क्यों मायने रखती हैं, फ़ॉलबैक कैसे काम करता है, फ़ॉलबैक मॉडल कैसे चुनें, और वह तेज़ मॉडल, बजट और इंसानी हैंडओवर के साथ कैसे फ़िट होता है।

ग्राहकों की बातचीत में मॉडल की विफलताएँ ज़्यादा क्यों चुभती हैं

किसी इंटरनल टूल में AI रिक्वेस्ट का फ़ेल होना बस एक झंझट है: आप रीट्राई दबा देते हैं। WhatsApp पर ग्राहक की बातचीत में यह टूटा हुआ वादा है। ग्राहक ने कुछ पूछा, ब्लू टिक देखे और अब जवाब का इंतज़ार कर रहा है।

कुछ बातें कस्टमर मैसेजिंग को ख़ास तौर पर संवेदनशील बनाती हैं:

  • ग्राहक रीट्राई नहीं करते। वे और झल्लाकर दोबारा लिखते हैं, या चले जाते हैं।
  • ट्रैफ़िक अचानक उछलता है। कोई कैंपेन, डिलीवरी में देरी या सेल मिनटों में बातचीत कई गुना कर सकती है, और ठीक तभी रेट लिमिट असर दिखाती है।
  • एजेंट कई कॉल करते हैं। एजेंट हार्नेस मॉडल को लूप में चलाता है, अक्सर हर ग्राहक मैसेज पर कई बार। एक फ़ेल कॉल पूरे रन को रोक सकती है।
  • WhatsApp पर समय मायने रखता है। फ़्री-फ़ॉर्म जवाब सिर्फ़ ग्राहक के आख़िरी मैसेज के 24 घंटे के भीतर ही दिए जा सकते हैं। लंबी रुकावट जवाब को उस विंडो के बाहर धकेल सकती है, जहाँ आपको अप्रूव्ड टेम्पलेट चाहिए होगा।

इनमें से कुछ भी किसी ख़ास प्रदाता के अविश्वसनीय होने की बात नहीं है। हर प्रदाता के यहाँ इंसिडेंट, मेंटेनेंस और क्षमता की सीमाएँ होती हैं। सवाल बस इतना है कि आपके एजेंट के पास इनकी कोई योजना है या नहीं।

क्या गड़बड़ हो सकती है

प्रदाता का आउटेज। आंशिक या पूरा, छोटा या लंबा। 99.9% मासिक उपलब्धता में भी 40 मिनट से ज़्यादा का डाउनटाइम हो सकता है।

रेट लिमिट। आपका अकाउंट प्रति मिनट एक तय संख्या में रिक्वेस्ट या टोकन की अनुमति दे सकता है। प्रदाता ठीक हो तब भी व्यस्त घंटा इस सीमा को छू सकता है।

टाइमआउट और धीमे जवाब। जो मॉडल आम तौर पर दो सेकंड में जवाब देता है, वह लोड में बीस सेकंड ले सकता है। फ़ोन पर बैठे ग्राहक को लगता है कि कुछ हो ही नहीं रहा।

बेकाबू रन। कोई एजेंट जो उलझी हुई रिक्वेस्ट पर लूप में फँस जाए, या कोई बातचीत जो बढ़ती ही जाए, सामान्य रन से कहीं ज़्यादा खर्च कर सकती है।

मॉडल में बदलाव। प्रदाता मॉडल अपडेट करते हैं और रिटायर करते हैं। जिस व्यवहार पर आप निर्भर थे, वह बहुत कम सूचना पर बदल सकता है।

एजेंट में फ़ॉलबैक कैसे काम करता है

विचार सरल है: जब मुख्य मॉडल काम पूरा नहीं कर पाता, तो दूसरा मॉडल कमान संभाल लेता है। MonoChat में फ़ॉलबैक मॉडल किसी सॉफ़्ट लिमिट के बाद या मुख्य मॉडल के फ़ेल होने पर कमान संभालता है। बातचीत, टूल और निर्देश वही रहते हैं; सिर्फ़ काम करने वाला मॉडल बदलता है।

हर AI एजेंट नोड में तीन भूमिकाएँ मिलकर काम करती हैं:

भूमिकायह क्या करती है
मुख्य मॉडलसोचता है, फ़ैसले लेता है और जवाब लिखता है
फ़ॉलबैक मॉडलसॉफ़्ट लिमिट या विफलता के बाद कमान संभालता है
तेज़ मॉडलबैकग्राउंड का काम संभालता है

इन भूमिकाओं के ऊपर, हर रन की बजट सीमा तय करती है कि एक बातचीत कितना ख़र्च कर सकती है।

फ़ॉलबैक मॉडल कैसे चुनें

दूसरे प्रदाता को तरजीह दें

उसी प्रदाता का फ़ॉलबैक आपको किसी एक मॉडल के गड़बड़ करने से बचाता है, पर उस प्रदाता के पूरे इंसिडेंट या आपके अकाउंट की रेट लिमिट से नहीं। दूसरे प्रदाता का मॉडल दोनों को कवर करता है। MonoChat आपको कस्टम LLM के ज़रिए कई प्रदाता कनेक्ट करने देता है, इसलिए यह एक कॉन्फ़िगरेशन का फ़ैसला है, कोई प्रोजेक्ट नहीं।

उसे पर्याप्त अच्छा बनाएँ, हूबहू वही नहीं

फ़ॉलबैक का उपलब्ध सबसे बेहतरीन मॉडल होना ज़रूरी नहीं। उसे आपके निर्देश मानने, आपके टूल सही कॉल करने और ठीक-ठाक जवाब लिखने आने चाहिए। उस पर भरोसा करने से पहले उसे अपने असली संवादों पर अलग से टेस्ट करें, मानो वही मुख्य मॉडल हो।

जाँचें कि वह आपके टूल संभालता है

एजेंट टूल कॉल पर निर्भर करते हैं: ऑर्डर देखना, स्लॉट जाँचना, टिकट बनाना। कुछ मॉडल स्ट्रक्चर्ड टूल कॉल में बाकियों से कहीं बेहतर होते हैं। जो फ़ॉलबैक सुंदर टेक्स्ट लिखे पर टूल ग़लत कॉल करे, वह बिना फ़ॉलबैक से भी बुरा है।

जिन भाषाओं में आप सेवा देते हैं, उनका ध्यान रखें

अगर आपके ग्राहक तुर्की, अरबी या स्पैनिश में लिखते हैं, तो पक्का करें कि फ़ॉलबैक उन भाषाओं को उतना ही अच्छा लिखता है जितना मुख्य मॉडल। गुणवत्ता या लहजे में अचानक बदलाव नज़र आता है।

दोनों दिशाओं में लागत पर विचार करें

सस्ता फ़ॉलबैक उन लंबे या असामान्य रनों की लागत घटाता है जो सॉफ़्ट लिमिट के आगे जाते हैं। महँगा फ़ॉलबैक भी ठीक हो सकता है अगर वह सिर्फ़ दुर्लभ विफलताओं को संभाले। तय करें कि आप फ़ॉलबैक से कौन-सा काम कराना चाहते हैं।

तेज़ मॉडल: भरोसेमंदी का दूसरा हिस्सा

हर चरण के लिए आपका सबसे अच्छा मॉडल ज़रूरी नहीं। बैकग्राउंड का काम, यानी जवाब के बजाय बातचीत के आसपास के काम, छोटे और तेज़ मॉडल पर चल सकता है। इससे मुख्य मॉडल की क्षमता और बजट उस चीज़ के लिए बचा रहता है जो ग्राहक को सचमुच दिखती है, और व्यस्त घंटों में मुख्य मॉडल पर रेट लिमिट छूने की संभावना घटती है।

व्यवहार में: सबसे मज़बूत रीज़निंग मॉडल को मुख्य रखें, दूसरे प्रदाता का एक भरोसेमंद मॉडल फ़ॉलबैक के रूप में, और बैकग्राउंड काम के लिए एक तेज़, सस्ता मॉडल।

बजट: सुरक्षा जाल के नीचे का सुरक्षा जाल

फ़ॉलबैक एजेंट को काम करता रखता है। बजट उसे किफ़ायती रखता है। हर रन की बजट सीमा का मतलब है कि कोई भी बातचीत, चाहे कितनी भी अजीब हो, आपकी योजना से ज़्यादा ख़र्च नहीं कर सकती। उस सॉफ़्ट लिमिट के साथ जिसके बाद फ़ॉलबैक कमान संभालता है, आपको एक अनुमानित पैटर्न मिलता है: सामान्य बातचीत मुख्य मॉडल पर चलती है, लंबी बातचीत फ़ॉलबैक पर जारी रहती है, और कुछ भी बेकाबू नहीं होता।

अपनी प्रदाता कुंजियों के साथ MonoChat AI पर कोई मार्कअप नहीं जोड़ता, इसलिए जो आप बजट करते हैं वही आपके प्रदाता चार्ज करते हैं।

फ़ॉलबैक हैंडओवर नहीं है

फ़ॉलबैक मॉडल को हर समस्या का जवाब मान लेना लुभावना है। वह नहीं है। फ़ॉलबैक तकनीकी विफलताएँ सुलझाता है: मॉडल डाउन है, धीमा है या बजट से बाहर है। हैंडओवर विवेक की समस्याएँ सुलझाता है: कोई शिकायत, कानूनी सवाल, आपकी सीमा से ऊपर का रिफ़ंड, या ऐसा ग्राहक जो बस किसी इंसान से बात करना चाहता है।

MonoChat में एजेंट फ़्लो के अंदर चलता है, इसलिए पूरी हिस्ट्री के साथ आपके शेयर्ड टीम इनबॉक्स में हैंडओवर हमेशा उपलब्ध रहता है। WhatsApp यह भी अपेक्षा करता है कि ऑटोमेटेड जवाब इंसान तक पहुँचने का स्पष्ट रास्ता दें। दोनों रास्ते डिज़ाइन करें:

  1. मुख्य मॉडल फ़ेल होता है या सॉफ़्ट लिमिट पर पहुँचता है → फ़ॉलबैक मॉडल जारी रखता है।
  2. केस को इंसान की ज़रूरत है → बातचीत की हिस्ट्री के साथ सही टीम को हैंडओवर।
  3. दोनों फ़ेल हों → फ़्लो ग्राहक को बताता है कि कोई इंसान जवाब देगा, और बातचीत इनबॉक्स में भेज देता है।

एक सरल चेकलिस्ट

  • मुख्य मॉडल आपके असली संवादों पर गुणवत्ता के आधार पर चुना गया हो।
  • फ़ॉलबैक मॉडल दूसरे प्रदाता का हो, और आपके टूल व भाषाओं के साथ अलग से टेस्ट किया गया हो।
  • बैकग्राउंड काम के लिए तेज़ मॉडल।
  • हर रन की बजट सीमा जो आपकी सामान्य बातचीत की लागत से थोड़ी गुंजाइश के साथ मेल खाती हो।
  • एजेंट के निर्देशों और फ़्लो में साफ़ हैंडओवर नियम।
  • पहले हफ़्ते के बाद संवादों के एक नमूने की समीक्षा, जिनमें फ़ॉलबैक पर चले संवाद भी शामिल हों।

एक बार सेट करें, हर चैनल के लिए

क्योंकि AI एजेंट नोड MonoChat फ़्लो में रहता है, वही मुख्य, फ़ॉलबैक और तेज़ मॉडल आपके एजेंट को WhatsApp, Instagram, Messenger, TikTok, Telegram, वेब चैट, SMS और वॉयस पर सुरक्षित रखते हैं। और क्योंकि Agent Harness आपको फ़्रेमवर्क चुनने देता है, यही तरीक़ा तब भी काम करता है जब आपका एजेंट MonoChat के बिल्ट-इन हार्नेस, Claude Agent SDK, OpenAI Agents SDK, Pi या आपके अपने फ़्रेमवर्क पर चले।

मॉडल की भूमिकाएँ आपस में कैसे फ़िट होती हैं, यह Agent Harness पेज पर देखें।

FAQ

अक्सर पूछे जाने वाले सवाल

AI एजेंट में फ़ॉलबैक मॉडल क्या होता है?

फ़ॉलबैक मॉडल एक दूसरा मॉडल है जो तब कमान संभालता है जब मुख्य मॉडल काम पूरा नहीं कर पाता, जैसे प्रदाता एरर लौटाए, रेट लिमिट आ जाए या रन की सॉफ़्ट लिमिट पूरी हो जाए। यह बातचीत को चलता रखता है, ताकि ग्राहक बिना जवाब के न रहे।

क्या फ़ॉलबैक मॉडल किसी दूसरे प्रदाता का होना चाहिए?

अक्सर हाँ। उसी प्रदाता का फ़ॉलबैक किसी एक मॉडल की समस्या से बचाता है, पर पूरे प्रदाता के आउटेज या आपके अकाउंट की रेट लिमिट से नहीं। दूसरे प्रदाता का मॉडल दोनों को कवर करता है, बशर्ते वह आपके एजेंट के काम के लिए पर्याप्त अच्छा हो।

फ़ॉलबैक मॉडल और तेज़ मॉडल में क्या अंतर है?

फ़ॉलबैक मॉडल मुख्य मॉडल के फ़ेल होने या सॉफ़्ट लिमिट पर पहुँचने पर उसकी जगह लेता है। तेज़ मॉडल उसके साथ चलता है और बैकग्राउंड का काम संभालता है, ताकि मुख्य मॉडल बातचीत पर ध्यान दे सके। MonoChat में हर AI एजेंट नोड में एक मुख्य, एक फ़ॉलबैक और एक तेज़ मॉडल होता है।

क्या फ़ॉलबैक मॉडल इंसानी हैंडओवर की जगह ले लेता है?

नहीं। फ़ॉलबैक मॉडल के फ़ेल होने पर एजेंट को काम करता रखता है। हैंडओवर उन मामलों में बातचीत किसी इंसान को सौंपता है जिन्हें एजेंट को नहीं संभालना चाहिए। अच्छे सेटअप में दोनों होते हैं: तकनीकी विफलताओं के लिए फ़ॉलबैक, और विवेक माँगने वाले मामलों के लिए हैंडओवर।

बजट सीमाओं का फ़ॉलबैक मॉडल से क्या संबंध है?

बजट सीमा तय करती है कि एक रन कितना ख़र्च कर सकता है। MonoChat में फ़ॉलबैक मॉडल सॉफ़्ट लिमिट के बाद कमान संभाल सकता है, इसलिए कोई लंबी या असामान्य बातचीत या तो रुकने या मुख्य मॉडल पर ख़र्च बढ़ाने के बजाय दूसरे मॉडल पर जारी रह सकती है।

संबंधित गाइड

इसी विषय पर और पढ़ें।

Growth का पहला महीना हमारी तरफ़ से

WhatsApp, Instagram और Messenger एक ही इनबॉक्स से चलाएँ

MonoChat के साथ मुफ़्त शुरू करें: आधिकारिक Meta API पर शेयर्ड टीम इनबॉक्स, AI असिस्टेंट, टेम्पलेट और कैंपेन।

हर बिज़नेस के लिए एक कोड • रिडीम करने के लिए 30 दिन • कार्ड की ज़रूरत नहीं

शुरू करने के लिए $150।

पाएँ